2026-08-01T18:15:24.906Z
AI Agente osservabilità: tracce di campioni, conservazione delle prove sanitarie
Una riproduzione di quarant'esemplari mostra perché il campionamento di tracce non deve cancellare i fallimenti dei risultati, le attese di approvazione, i tempi di esecuzione irraggiungibili o le consegne mancanti.
L' osservabilità dell' agente AI non dovrebbe richiedere la conservazione di ogni traccia, ma non dovrebbe mai permettere al campionamento di traccia di decidere se esiste un evento sanitario critico. Prendete un campione del percorso diagnostico pesante quando il volume o il costo lo richiedono. Inviare ricevute di salute compatte e stampate fallimento dei risultati, attesa di approvazione, fallimento degli strumenti, tempo di esecuzione irraggiungibile e mancato di consegna attraverso un percorso separato con controlli di consegna e freschezza. Quella divisione risolve un problema specifico. Una traccia è un'eccellente prova del perché una corsa si è comportata così. Non è l'unico luogo da cui un operatore può sapere che manca il lavoro previsto. Un tempo di corsa che non può essere raggiunto potrebbe non emettere alcuna traccia. Una sessione che aspetta correttamente l'approvazione può non avere un intervallo di errori. Una corsa può finire con spazi OK mentre un verificatore esterno trova che il file richiesto non esiste. La ragionevole impostazione è quindi due politiche di conservazione, non un campionatore intelligente: applicare campionamento di testa o coda alle tracce diagnostiche e conservare ogni ricevuta sanitaria obbligatoria per un periodo più breve e esplicitamente limitato. Unire i due registri con un'identificazione di esecuzione stabile quando una traccia è disponibile. Non immagazzinare informazioni crude o carichi di utensili illimitati solo per mantenere il verdetto sulla salute. Tracce di campioni; conservare le ricevute sanitarie Documentazione del campionamento di OpenTelemetry utilizza una definizione ristretta e utile: una traccia campionata viene lavorata ed esportata; una traccia che non è campionata non viene lavorata o esportata. Il campionamento della testa si decide in anticipo, generalmente a partire da un identificatore di traccia e dalla percentuale desiderata, senza ispezionare l'intero traccia. Il campionamento della coda attende più o tutte le tracce e può tenere tracce per errore, latenza, attributi o altri criteri. Questi meccanismi ottimizzano una popolazione di tracce. Una politica sanitaria degli agenti risponde a una domanda diversa: quali osservazioni sono necessarie per decidere se il lavoro è sano, in attesa, bloccato, irraggiungibile o falsamente completato? Registrazione Scopo Impiego di campionamento predefinito Esempio di prove Traccia diagnostica Spiegare l' esecuzione e il debug di una esecuzione selezionata campione se giustificato dal volume e dal costo intervalli, durata degli strumenti, chiamate di modello, percorso di errore Racconto sanitario Conservazione di un fatto operativo che cambia lo stato Conservare ogni tipo obbligatorio Il predicato di risultato è fallito, è richiesta l'approvazione, il battito cardiaco non è stato raggiunto. Metrica aggregata Tassi di misurazione e capacità Aggregato prima dello stoccaggio, ove possibile tasso di riprova, profondità della coda, perdita di ricevimento Carico utile sensibile Riproduce contenuti solo sotto un'autorità separata Non raccogliere per impostazione predefinita Pronto, argomentazioni degli strumenti, risposta grezza La distinzione non rende inutile il campionamento della coda. Una regola di coda che conservi sempre tracce contenenti uno spazio ERROR è preziosa. Non può ancora conservare una traccia che non è mai arrivata, e non può dedurre che una traccia che sembra avere successo non abbia superato un controllo esterno di consegnabilità. La documentazione del processore di campionamento della coda del collezionista è esplicita su un importante presupposto: tutti gli spazi per una traccia devono raggiungere la stessa istanza del collezionista per una decisione efficace. Tratta questo prerequisito come un limite, non come un difetto. Il campionamento delle tracce è effettuato dopo l'esistenza di prove di tracce. Le ricevute sanitarie devono coprire anche i fallimenti al di fuori di tale percorso. Definire il contratto sanitario non campionato Tenete la ricevuta abbastanza piccola da mantenere ogni tipo obbligatorio come ordinario, non come eroico. Un registro utile ha bisogno di identità, semantica, freschezza delle prove e fontenon di una trascrizione: I due orologi contano. La Modello di dati OpenTelemetry Logs stabile definisce Timestamp come il momento in cui un evento è avvenuto alla fonte e ObservedTimestamp come il momento in cui il sistema di raccolta l'ha osservato. Conservare entrambe le semantiche in una ricevuta sanitaria. Un ricevimento ritardato può ancora descrivere un fallimento reale, ma il suo ritardo di consegna e l'età di prova dovrebbero rimanere visibili. Utilizzare un breve registro obbligatorio di tipo di proprietà del flusso di lavoro, non del fornitore di stoccaggio. Un set di partenza per le operazioni degli agenti potrebbe essere: outcome failed : un verificatore specifico ha respinto il risultato promesso; approval wait : la corsa ha una dipendenza umana tipografata e un proprietario; tool error : un'operazione obbligatoria dello strumento non è riuscita dopo la sua politica di riprova limitata; runtime unreachable : un osservatore esterno non è riuscito a raggiungere il tempo di esecuzione entro la scadenza prevista; missing deliverable : la corsa è stata dichiarata completata ma l'artefatto previsto è stato assente. Il produttore fa parte del contratto. Un verificatore di risultati può emettere outcome failed ; un adattatore di tempo di esecuzione può emettere approval wait ; un programmaio esterno o un osservatore del battito cardiaco devono emettere runtime unreachable . Il richiedere un tempo di esecuzione irraggiungibile per segnalare la propria irraggiungibilità è un progetto circolare. Per ogni ricevuta, applicare quattro controlli prima che cambi la salute: 1. Detuplicare con receipt id o con una chiave di evento stabile. 2. Convalidare schema version , kind , run id e l'autorità del produttore. 3. Confronta occurred at e observed at con i limiti di freschezza per tipo. 4. Aggiornare la salute con priorità esplicita, preservando unknown quando mancano le prove richieste. Non lasciare che un ricevimento autorizza un'azione irreversibile. Può aprire un numero, trasmettere una richiesta o preparare una risposta limitata. Il recupero richiede ancora il limite di approvazione pertinente e una nuova osservazione che dimostri un utile progresso o il risultato atteso. Ripetizione della decisione di conservazione Il dispositivo conservato contiene quarant'anni sintetici e cinque casi critici deliberatamente diversi. Il campionamento deterministico del 10% di testa hashes ogni traccia ID. La politica della coda tiene tracce il cui stato di span è ERROR . La terza polizza conserva tutte le ricevute sanitarie registrate. Fate partire con: Il risultato fisso è: Il campione di testa tiene 1, 3, 10, 25, 39 in esecuzione. La corsa 25 è il caso di errore degli strumenti, quindi altri quattro casi critici sono assenti dal suo campione. La regola della coda solo ERROR mantiene anche l'errore dello strumento. Manca un fallimento di risultato trasportato da una traccia OK , un'attesa di approvazione trasportata da una traccia UNSET , un prodotto mancato trasportato da una traccia OK e il tempo di esecuzione irraggiungibile che non ha prodotto tracce. Questo è un test politico, non un risultato statistico. Le cinque piste critiche sono state deliberatamente distribuite in modo che il replay contenga sia un caso conservato che casi mancati. Non afferma che il campionamento del 10% catturi solitamente un quinto degli incidenti o che questi cinque tipi di eventi abbiano la stessa frequenza. Cambiare le ID di traccia, la regola di campionamento o il dispositivo e i conteggi possono cambiare. Ciò che non dovrebbe cambiare è il criterio di accettazione: ogni tipo di ricevimento obbligatorio deve sopravvivere al percorso sanitario, compresi i casi senza traccia. Aggiungere un nuovo verdetto operativo solo dopo aver aggiunto il suo produttore, schema, dispositivo, regola di conservazione e monitor di perdita. Monitorare il percorso di ricevimento e la conservazione legata Un canale non campionato può comunque fallire. L'eccesso di code, il rifiuto di schemi, le credenziali scadute, gli errori dell'orologio, i bug del produttore e le interruzioni di stoccaggio possono far scomparire le prove di salute. Monitorare il canale con segnali che non dipendono esclusivamente dal canale stesso: il numero di ricevute attese in base al produttore e al flusso di lavoro; il battito cardiaco del produttore e l'ultimo tempo di consegna con successo; i contatori di ricevimento rifiutati, duplicati e ritardati; capacità di coda dei collezionisti e dei contatori a goccia; canarie periodiche end to end con identificatore di ricevimento noto; la riconciliazione tra i percorsi pianificati, i risultati dichiarati e i risultati ricevuti. L'assenza non deve diventare verde. Se un verificatore di risultato non ha segnalato una corsa che lo richieda, segnalare il segnale di risultato non disponibile o incerto. Se l'osservatore esterno stesso è obsoleto, non pretendere che il tempo di esecuzione sia raggiungibile. Uno strato sanitario deve rivelare le lacune nelle sue prove. Conservare ogni ricevuta sanitaria non significa conservarla per sempre. Scegliere la conservazione dalla decisione operativa: abbastanza a lungo da indagare, conciliare le prove ritardate e controllare un intervento approvato. Conteggiare i conti più vecchi quando non sono più necessari i registri individuali. Prima di esportare, rimuovere o hashare i percorsi locali, il contenuto dell'utente, il testo prompt, i carichi utili degli strumenti e il materiale di credenziale. Conservare una classe di errore di digest o di bounded quando supporta la decisione. Il compromesso è esplicito. Un canale obbligatorio compatto costa un'ingegneria aggiuntiva e duplica una piccola quantità di metadati di traccia. In cambio, i controlli del volume delle tracce non possono cancellare in silenzio i fatti che guidano la salute. Il campionamento della coda rimane utile per selezionare i dettagli diagnostici intorno agli errori noti; un ricevimento obbligatorio fornisce l'incidente anche quando lo stato di traccia è riuscito, incompleto o assente. Prima di adottare il modello, riproduci veri casi disinfettati da un solo flusso di lavoro: completamento sano, falso successo, attesa di approvazione, guasto degli strumenti, battito cardiaco mancato e interruzione del collezionista. Verifica entrambe le parti. La politica sui tracciamenti dovrebbe soddisfare il suo obiettivo di costo e la politica sui ricevimenti dovrebbe mantenere ogni verdetto richiesto senza raccogliere carichi utili sensibili. La direzione del prodotto di Sidewisp è uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti: prove, freschezza, progressi utili, stati di attesa, risultati verificati e confini espliciti di approvazione. Non si tratta di un sistema di sostituzione, di un gateway obbligatorio, di un prodotto di tracciamento grezzo o di un fissatore autonomo. Sidewisp è attualmente in anteprima privata. Il sito pubblico e il sistema di articoli sono in diretta, mentre la raccolta dell'agente di produzione sanità, gli adattatori di runtime, la gestione cron, l'analisi dei costi dei token e il recupero non sono generalmente spediti. Se questo limite di conservazione delle prove corrisponde alle modalità di fallimento necessarie per operare, puoi unirti alla visualizzazione privata e descrivere i tipi di runtime e ricevimento che contano. Referenze primarie OpenTelemetry: campionamento terminologia del campionamento di tracce, campionamento di testa e coda e compromessi operativi; riesaminato il 26 luglio 2026. OpenTelemetry Collector Contrib: Processore di campionamento della coda raggruppamento di tracce, tipi di politiche, affinità collettiva, tracce abbandonate e intervalli tardivi; rivisto il 26 luglio 2026. OpenTelemetry: Modello di dati dei registri semantica stabile di Timestamp e ObservedTimestamp ; rivista il 26 luglio 2026.