2026-08-01T22:24:08.321Z

Agentic AI Osservabilità: Diagnosi dei lucchetti morti con un grafico di attesa

Costruire e testare un grafico di attesa che separa l'attesa normale, l'approvazione umana, le dipendenze irraggiungibili, i cicli freschi e gli stallo di coordinamento.

Agentico AI l'osservabilità deve rispondere a una domanda di coordinamento che la telemetria ordinaria delle richieste lascia aperta: chi aspetta chi, e questa attesa è ancora legittima? Il default pratico è di due strati. Conservare le tracce per i dettagli di esecuzione causale, quindi mantenere una piccola applicazione di livello grafico di attesa per le dipendenze attive. Ogni bordo diretto dice che un agente non può continuare finché un altro agente, una persona o un sistema esterno non fornisce qualcosa di specifico. Un vantaggio aciclico per un agente di lavoro è di solito una normale attesa. Un vantaggio per una persona è uno stato di bisogni umani. Un ciclo chiuso da agente a agente è un avvertimento, ma diventa candidato a blocco solo quando ogni partecipante ha anche smesso di fare progressi utili per un intervallo calibrato. Questa condizione finale conta. Riattivare un agente sano perché il suo spans è tranquillo distrugge il contesto. Ripartire un intero gruppo perché un grafico contiene un nuovo ciclo può duplicare le chiamate degli strumenti. L'operatore ha bisogno di topologia, di freschezza e di un risultato atteso, non di una sola luce occupata. Tracce mostrano l'esecuzione; bordi di dipendenza spiegano la pausa L'attuale orientamento di osservabilità di Microsoft AI raccomanda tracce end to end che collegano i passaggi di esecuzione dell'agente, con identificatori di esecuzione, invocazioni di strumenti e agenti, e sufficiente contesto per ricostruire gli incidenti. Si dice anche che la latenza, gli errori e il throughput sono troppo ristretti per stabilire la qualità e l'affidabilità del sistema AI. Questa è una base utile, ma non definisce la promessa della domanda tra due agenti collaboratori. Le emergenti OpenTelemetry convenzioni di span degli agenti GenAI forniscono il vocabolario per operazioni come invoke agent , invoke workflow , plan e execute tool , oltre a identificatori di agenti stabili se disponibili. Il documento è esplicitamente contrassegnato come Development . Trattala come uno strato di interoperabilità in evoluzione, non come un permesso di fingere che un attributo proposto dimostri che il tuo flusso di lavoro è completato. Immaginate che un agente di ricerca inviti un recensore. Il periodo di invocazione può terminare con successo anche se il revisore non ha accettato l'incarico, l'esaminatore sta aspettando un contratto di destinazione o il pacchetto sorgente richiesto non è mai arrivato. L'intervallo descrive l'invocazione. Il record di dipendenza descrive il motivo per cui l'operazione più ampia non può andare avanti. Utilizzare entrambe. Non sovraccaricare lo stato di span con risultati di applicazione che non può supportare. Registrare il contratto di attesa minimo Un vantaggio utile è deliberatamente piccolo. Ha bisogno di identificatori operativi stabili e di freschezza, non di richieste o di catena di pensiero: operation id contiene il grafico. waiter → blocker fornisce la sua direzione. blocker type distingue un agente da un servizio umano o esterno. since vi dice quanto tempo la dipendenza è esistita, mentre last progress at si riferisce a un movimento utile in questa operazionenon a battito cardiaco, flusso di token o ripetuti tentativi. reason deve indicare la condizione mancante. authority impedisce che un cancello di approvazione venga recuperato come se si trattasse di un processo fallito. Tieni il contenuto fuori dai limiti. Un identificatore di attività, un hash di artefatto, un codice di ragione modificato e un identificatore di correlazione traccia sono di solito sufficienti. Le linee guida di Microsoft mettono la minimizzazione dei dati, la conservazione, il controllo degli accessi e la privacy al fianco dell'utilità forense. Un grafico di attesa dovrebbe aiutare a individuare le prove; non dovrebbe diventare un secondo negozio di richieste, argomenti di strumenti, segreti o contenuti consegnabili. L'illustrazione sopra è una normale pausa. La catena è aciclica, il lavoro a monte è fresco, e l'ultimo bloccante è esplicita autorità umana. Nessun agente di riavvio puo' fornire quell'autorità. L'azione corretta è quella di indirizzare la decisione al proprietario con le prove pertinenti. Un ciclo grafico è una prova, non un verdetto Il rilevamento dei cicli è economico. La diagnosi non lo è. Per ogni operazione attiva, costruire un grafico diretto da bordi agente to agente e eseguire una ricerca di profondità prima o fortemente collegati componenti algoritmo. Un componente con più di un nodo o un bordo autonomo contiene un ciclo. Poi valutate tre condizioni indipendenti: 1. Coverage: sono rappresentati tutti i partecipanti attivi e le dipendenze, oppure manca la telemetria? 2. Freshness: quando è stata l'ultima volta che ogni partecipante ha modificato l'artefatto previsto, la decisione o lo stato di attività verificato? 3. AAutorità: , c'è qualche vantaggio che aspetta intenzionalmente una persona, una credenziale, una scelta irreversibile o un servizio esterno? Chiamare il ciclo obsoleto solo quando l'età di ultima progressione più giovane in quel ciclo supera la soglia. L'utilizzo dell'età più vecchia è un bug sottile: un partecipante a lungo in silenzio potrebbe rendere un ciclo bloccato anche mentre un altro partecipante ha cambiato la produzione secondi fa. La soglia è specifica per il carico di lavoro. Cinque minuti sono plausibili per un veloce ciclo di revisione del codice locale e assurdo per un agente di ricerca in attesa di una lunga costruzione. Iniziare da un intervallo di progresso atteso per tale operazione, aggiungere un intervallo di trasporto e di programmazione e mantenere uno stato UNCERTAIN CYCLE quando le prove sono troppo fresche o incomplete. Questa distinzione protegge anche contro la pregiudizia dell'orologio. Se i timestamp provengono da diversi ospiti, o li normalizzano attraverso un collezionista di fiducia o portano un orologio fonte e incertezza legata. Un'età negativa o incredibilmente elevata dovrebbe ridurre la fiducia, non innescare il recupero. Riproduci cinque stati di coordinamento Ho testato la regola con otto bordi NDJSON raggruppati in cinque operazioni. Il tempo di fissaggio è 2026 07 24T18:30:00Z , e la finestra illustrativa obsoleta è di 300 secondi. Il classificatore applica l'ordine seguente: L'ordine fa parte del contratto di sicurezza. Se si verificano i cicli prima dell'autorità, un margine di approvazione umana rappresentato da un agente proxy può essere mal gestito. Se si verifica solo la freschezza, un negozio di artefatti irraggiungibile e un gruppo di agenti che si aspettano reciprocamente crollano nello stesso termine generico anche se le loro riparazioni differiscono. Classificatore deterministico prodotto: I due cicli hanno la stessa forma. Le loro conclusioni operative differiscono perché il ciclo a due agenti ha cambiato lo stato utile 1520 secondi fa, mentre ogni membro del ciclo a tre agenti è stato silenzioso per almeno 1.860 secondi. La sola topologia non può prendere questa decisione. Il test espone anche una modalità di fallimento nelle schede di controllo all agents online. Ogni partecipante a op cycle può rispondere a un battito cardiaco e non essere ancora in grado di avanzare. Al contrario, op approval può rimanere in silenzio per venti minuti senza essere rotto. La raggiungibilità è un segnale; la risoluzione della dipendenza è un'altra. Rompere un bordo, poi verificare il risultato Un ciclo obsoleto richiede un'indagine prima dell'intervento. Aprire le tracce correlate, esaminare le ragioni di dipendenza, e identificare il più piccolo bordo reversibile che può essere risolto senza inventare l'autorità mancante. Per il sistema di tre agenti, l'editore aspetta un pacchetto di fonti, il ricercatore aspetta note di revisione e il revisore aspetta un contratto di destinazione. Se il contratto di destinazione esiste già in immagazzinamento duraturo, l'aggiunta di tale prova al compito del revisore può rompere in modo sicuro un vantaggio. Riprendere tutti e tre gli agenti sarebbe un'azione molto più grande e potrebbe ripetere il lavoro esterno. Utilizzare un record di recupero limitato: il bordo selezionato e le prove a sostegno della diagnosi; l'azione reversibile esatta proposta; chi l'ha approvata, quando è richiesta l'approvazione; un termine, un nuovo tentativo e un limite di costo; il segnale di progresso atteso successivamente; l'artefatto o il risultato che deve essere verificato in modo indipendente. Non eliminare l'incidente perché un comando di spinta o di riprova ha restituito zero. Prima cercare una transizione di bordo, poi un progresso utile, e infine l'uscita prevista. Se il rapporto previsto manca ancora, l'operazione non è risolta anche se ogni traccia è verde. La Overview dell'osservabilità dell'agente OpenTelemetry spiega perché la telemetria standardizzata è importante in tutti i quadri e perché la telemetria degli agenti alimenta anche la valutazione. Il grafico di attesa integra la telemetria; non sostituisce tracce, registri, valutazioni o controlli di risultati. Sappiate cosa non può dimostrare il grafico Un grafico di attesa è solo così completo quanto i suoi scrittori. Un agente incastrato può fallire prima di emettere il suo bordo. Un agente difettoso può segnalare un progresso insignificante. Una credenziale scaduta potrebbe apparire come un'attesa esterna generica. Una coda può ritardare un evento abbastanza a lungo da creare un falso ciclo temporaneo. Trattare queste cose come limitazioni esplicite: I bordi mancanti producono falsi negativi. Gli orologi obsoleti o inclinati distorcono la freschezza. Contatori di progresso senza attività di ricompensa dell'artefatto delta. Un ciclo può scomparire mentre il prodotto richiesto rimane mancante. Uno scrittore malvagio o compromesso può falsificare il proprio stato. Mitigateli con la freschezza del collezionista, gli scrittori autenticati, i numeri di sequenza monotonici, gli hash degli artefatti, la correlazione tra tra tracce e la verifica dei risultati. Quando i segnali non sono d'accordo, restituire UNCERTAIN e chiedere prove. L'incertezza è uno stato operativo, non un motivo per rendere il recupero più aggressivo. La regola risolta è compatta: tracciare il lavoro, registrare le dipendenze attive, rilevare i cicli, richiedere prove obsolete di progresso utile, preservare l'autorità umana, cambiare un bordo limitato e verificare il risultato previsto. Questo è sufficiente a trasformare gli agenti occupati ma niente sta accadendo in una diagnosi che un operatore può controllare. Sidewisp è attualmente in anteprima privata. Gli adattatori di monitoraggio della produzione e il motore di recupero non vengono generalmente spediti. Se una visione della salute che separa il lavoro, l'attesa, i bloccati, gli agenti incerti e i bisogni umani aiuterebbe la tua operazione, puoi unirti alla visualizzazione privata senza sostituire il tuo tempo di esecuzione esistente.