2026-08-01T01:58:05.371Z

LLM Osservabilità: controllo del contratto di cronologia dell'agente

Testare il raggruppamento delle conversazioni, l'attribuzione degli agenti, la correlazione degli strumenti e la propagazione degli errori prima di fidarsi di Honeycomb Agent Timeline.

Honeycomb puo' mostrare una cronologia pulita dell'agente e ancora lavorare da un contratto di eventi rotto. Prima di utilizzare questa visualizzazione per diagnosticare un incidente multi agente, verificare sei cose negli intervalli emessi: un'identità di conversazione, nomi distinti di agenti, attribuzione di invocazione del lato dell'appellante, nomi di operazioni riconosciuti, ID di chiamata stabile degli strumenti e errori propagati. Il test pratico non è è arrivata la telemetria? È potrebbero questi campi proiettare il lavoro nella giusta conversazione, nel percorso dell'agente, nell'operazione e nello stato di guasto? L'audit di seguito risponde a questa domanda più ristretta con otto apparecchiature prive di contenuti. not raccoglie richieste o afferma che una linea temporale pulita dimostra il risultato esterno richiesto. Che cosa in realtà proietta l'agente Honeycomb Timeline Honeycomb documenta l'Agente Timeline come una visione di intere conversazioni che possono coprire più tracce. La chiave di conversazione e' gen ai.conversation.id . All'interno di una conversazione, gli intervalli di GenAI sono raggruppati da gen ai.agent.name , quindi presentati come invocazioni di agente, operazioni LLM e chiamate di strumento secondo gen ai.operation.name . Ciò rende la vista utile, ma rende anche diversi campi forniti da applicazioni parte del confine diagnostico: gen ai.conversation.id decide quali spazi appartengono insieme. gen ai.agent.name decide quale agente possieda una corsia. gen ai.operation.name decide se un intervallo viene trattato come chat, invocazione da agente o esecuzione di strumento. gen ai.tool.call.id consente all'operatore di correlare una richiesta di strumento con il suo risultato. i campi di stato di errore e di eccezione decidono se un errore è visibile nello spazio di riferimento interessato e al suo punto di partenza. La guida degli strumenti di Honeycomb segna l'ID della conversazione, il nome dell'agente e il nome dell'operazione come richiesto per la visualizzazione dell'agente. Dice anche che un nome mancante dell'agente appare come Unknown , e che i nomi duplicati impediscono agli operatori di distinguere gli agenti durante un'indagine. La stessa guida rende esplicita una regola di attribuzione facile da perdere: l'agente calling emette lo spans invoke agent . L'agente chiamato emette il suo chat , execute tool e altri spazi sotto il suo nome unico. Se una trasformazione collettiva assegna l'invocazione alla chiamata, la linea temporale può contenere ogni intervallo che racconta la storia causale sbagliata. Questo è un problema di conformità di schema prima di essere un problema di pannello. Chiedendo più duramente non riesce a recuperare un'identità che non è mai stata rilasciata o a correggere un nome di agente che due lavoratori condividono. Audito del contratto di proiezione prima di un incidente Il dispositivo di accompagnamento contiene otto piccoli set di span. Nessuna contiene richieste, risposte, argomentazioni sugli strumenti, identificatori dei clienti o segreti. Gli unici valori sono ID di conversazione sintetiche, istanze di agente, nomi di agenti, nomi di operazioni, collegamenti genitori, ID di chiamata degli strumenti e campi di stato. Eseguire l'audit dalla directory degli artefatti degli articoli: Il classificatore applica i controlli in ordine causale: 1. Tutti gli spazi della conversazione proposta devono condividere un documento non vuoto. 2. Ogni spa deve avere un nome non vuoto. 3. Un nome di agente visualizzato non deve appartenere a più istanze di agente. 4. Il richiedente deve possedere un intervallo invoke agent . 5. L'operazione deve appartenere all'insieme di operazioni GenAI documentato utilizzato dalla proiezione. 6. Un intervallo execute tool deve conservare un identificatore di chiamata utente. 7. L'errore di un bambino non deve essere inferiore a quello di un genitore che segnala ancora il successo. L'ordine conta. Se una conversazione è già divisa tra conv 201 e conv 202 , contare le corsie dell'agente all'interno di entrambi i frammenti dà una risposta precisa alla domanda sbagliata. Allo stesso modo, se due processi si chiamano entrambi worker , la correlazione strumento chiamata non può ripristinare l'identità dell'agente mancante. Le regole sono intenzionalmente più rigorose di quanto non sia un'osservazione. Un'involucro di span conforme è la prova che l'osservazione è stata raggruppata e attribuita in base a un contratto dichiarato. Otto apparecchi espongono sette diversi falsi verdi La regola ingenuo di confronto controlla solo che ogni intervallo abbia un ID di conversazione. Essa accetta tutte le otto modalità, compresi i casi in cui due ID non vuoti separano una conversazione logica. L'audit di conformità accetta esattamente una: Fabbricazione Controllo di identità ingenuo Verdetto di conformità Riparazione necessaria Conversazione valida passaggio CONFORMANT nessuna Conversazione frammentaria passaggio FRAGMENTED CONVERSATION diffondere un ID di conversazione attraverso i confini tracciabili Agente sconosciuto passaggio UNKNOWN AGENT emette un nome stabile e non vuoto dell'agente Agente nome collizione passaggio AGENT NAME COLLISION dare a ciascuna istanza di agente un nome operativo distinto attribuzione di un'invocazione errata passaggio INVOKE ATTRIBUTION INVALID emittere invoke agent dal richiamatore operazione non riconosciuta passaggio OPERATION UNRECOGNIZED ripassaggio a un'operazione documentata di GenAI Identificazione dell'appello per lo strumento mancante passaggio TOOL CALL UNCORRELATED conservare l'ID di chiamata tra la richiesta e il risultato errore di bambino nascosto passaggio ERROR PROPAGATION BROKEN diffondere lo stato di fallimento al genitore Ogni verdetto protegge una decisione diversa dell'operatore. Una conversazione frammentaria nasconde il lavoro. Un nome sconosciuto o in collisione corrompe la proprietà. L'attribuzione di invocazione sbagliata invertisce chi ha delegato a chi. Un'operazione non riconosciuta fa cadere un evento nella categoria visiva sbagliata. Un'identificazione di chiamata mancante rende un timeout pericoloso da riconciliare. Un errore nascosto di un bambino trasforma un percorso di strumenti fallito in un genitore che sembra di avere successo. L'ultimo caso merita una particolare attenzione. Honeycomb consiglia di registrare errori in modo coerente e di propagare un fallimento della chiamata degli strumenti alla durata genitoriale. Tale propagazione non dimostra se un effetto collaterale esterno è stato commesso; impedisce al genitore di rimanere silenziosamente verde mentre si sa che un bambino ha fallito. Per gli strumenti efficaci, aggiungere una ricevuta di destinazione separata dopo questo controllo telemetrico. Un timeout più nessuna risposta è un effetto incerto, non il permesso di riprovare. Il Timeline dell'agente può aiutare a individuare l'appello ambiguo; la destinazione autorizzata deve decidere se l'effetto esiste. Trasformare l'audit in un canario di distribuzione Prima esegui il dispositivo localmente, poi adatta una conversazione canaria innocua al tuo percorso di strumentazione. Tenere il contenuto canario libero e rendere la sua topologia ovvia: un agente del router invoca un lavoratore; il lavoratore esegue una sola chiamata senza pregiudizio; ogni spannaggio riceve lo stesso ID di conversazione sintetico; il router e il lavoratore hanno nomi distinti; l'invocazione appartiene al router; l'appello di strumento conserva un ID di chiamata sintetico; una variante di prova fallisce deliberatamente lo strumento e verifica che il motore non abbia più successo. Confronta l'envelope emessa prima dell'esportazione e dopo qualsiasi trasformazione del Collector OpenTelemetry. Questo cattura un comune errore di confine: l'istrumentazione sorgente è corretta, ma una trasformazione si estende, lascia cadere un attributo o assegna un nome di agente statico a ogni processo. Fatti passare quella trasformazione. Le convenzioni semantiche dell'agente OpenTelemetry GenAI ispezionate per questo articolo sono contrassegnate come Development , quindi un upgrade SDK o Collector non è un cambiamento visivo di routine. E' un cambiamento di schema che dovrebbe riprodurre il canario. Utilizzare un piccolo record di accettazione per ogni rilascio: Non inserire richieste, risposte, argomentazioni sugli strumenti o risultati degli strumenti in questo registro. Honeycomb osserva che il contenuto del messaggio può contenere PII e raccomanda di inserire tale contenuto in eventi di span in cui un Collector può filtrarlo. Il canario di conformità ha bisogno di identità e status, non di contenuti di conversazione. Dove questo test si ferma Passare l'audit significa che l'envelope di span fornito può essere proiettato coerentemente nella Timeline dell'agente Honeycomb. Essa non stabilisce che: ogni spalla raggiunto Honeycomb; il campionamento ha mantenuto il guasto critico; un agente sta compiendo progressi utili; una legittima attesa umana ha un proprietario e una scadenza; un effetto collaterale di uno strumento commesso esattamente una volta; esiste il fascicolo, il biglietto, la distribuzione o il rapporto promesso; la risposta è factualmente o semanticamente corretta. Sono questioni di salute separate. Tratta la conformità della linea temporale come il biglietto d'ingresso per la diagnosi, non il verdetto finale sulla salute. Dopo che è passato, aggiungere freschezza, stato di attesa, effetto e ricevute di risultato in base al rischio del flusso di lavoro. Questo limite è anche il motivo per cui l'esperimento dell'articolo non paragona Honeycomb ad un altro venditore. La decisione del lettore è più anteriore e più concreta: Posso fidarmi della conversazione e dell'attribuzione dell'agente che sto per indagare? Sidewisp è attualmente in anteprima privata. È destinato ad aggiungere uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti, ma la raccolta dell'agente di produzione salute, gli adattatori Honeycomb e il recupero automatico non vengono spediti nel repository del sito web corrente. Se stai definendo il limite delle prove per i tuoi agenti ora, la lista d'attesa di anteprima privata è il modo appropriato per condividere quella necessità di integrazione. Fonti Cucina di miele: Agenti di strumentazione AI Agente Timeline OpenTelemetry Convenzioni semantiche dell'agente GenAI all'impegno ispezionato