2026-08-01T03:55:24.749Z
Azure LLM Osservabilità: audit del Green Gap campionato
Testare la freschezza delle tracce, la visibilità RBAC, la copertura della valutazione, le attese legittime e la ricevuta di destinazione prima di trattare una fonderia verde come sana.
Azure LLM osservabilità dovrebbe rispondere a più di ha una corsa terminata? Prima di accettare un verdetto sano, dimostrare quattro condizioni per la stessa corsa: la telemetria è consultabile e fresca, lo stato di esecuzione è compreso, ogni controllo di qualità richiesto ha effettivamente coperto la corsa, e il risultato promesso esiste alla sua destinazione. Microsoft Foundry vi dà pezzi utili di questa prova. Può posizionare tracce del lato del server in Azure Monitor Application Insights, mostrare le metriche operative nel Dashboard di monitoraggio degli agenti e eseguire valutazioni rispetto alle risposte di produzione campionate. Questi pezzi non sono intercambiabili. Una traccia può essere fresca mentre un valutatore ha saltato la corsa. Un valutatore può passare mentre un file, un biglietto, una distribuzione o un messaggio non hanno mai raggiunto la destinazione. Una corsa completata può anche essere in attesa di una decisione umana legittima che l'applicazione ha modellato male. Il default pratico è quindi un audit di copertura, non un punteggio composto. Tenere disponibili prove non disponibili, considerare il campionamento come una copertura piuttosto che un successo, e lasciare che un ricevimento di risultati specifico per il carico di lavoro colma il divario finale. Leggi le superfici della fonderia come prova separata Microsoft l'insieme dell'osservabilità separa tre capacità: Tracing registra il percorso di esecuzione, comprese le chiamate di modello, l'uso degli strumenti, la latenza e gli intervalli correlati. Monitoring riassume misure operative come token, latenza, tasso di errore e successo di esecuzione. Evaluation misura proprietà di qualità o di sicurezza selezionate con valutatori integrati o personalizzati. Che la separazione sia importante durante un incidente. Una durata di successo stabilisce che un'operazione strumentalizzata ha raggiunto lo status di terminal. Essa non stabilisce che l'attuale tabella di controllo possa vedere tutti gli intervalli pertinenti, che un valutatore abbia esaminato questa risposta o che sia avvenuto l'effetto collaterale richiesto. guida di configurazione di tracciamento rende espliciti due confini utili. In primo luogo, il tracciamento server side dell'agente ospitato inizia dopo che il progetto è collegato a Application Insights. In secondo luogo, le nuove tracce possono richiedere qualche minuto per apparire. Se la traccia prevista è assente, il verdetto responsabile non è failed o healthy. È evidence non disponibile fino a quando non si distingue connessione, autorizzazione, ritardo di ingestione, campionamento e strumentazione. L'accesso richiesto è un'altra condizione indipendente. La documentazione di monitoraggio di Foundry richiede un accesso adeguato basato su ruoli di Azure a Application Insights e, per le visualizzazioni di log, allo spazio di lavoro di Log Analytics associato. Un operatore che può aprire il progetto ma non può consultare la telemetria protetta ha un problema di visibilità, non prove di un agente sano. La stessa precauzione si applica alla scheda Monitor. Il Guida di Controllo Agente descrive il tasso di successo di esecuzione, i token, la latenza e i risultati di valutazione. Si dice anche che la valutazione continua è eseguita sulle risposte campionate . Il campionamento è una valida decisione sul costo e sul rendimento, ma crea una domanda denominatrice: questa corsa in particolare ha ricevuto tutte le valutazioni necessarie per la decisione che stai prendendo? Non rispondere a questa domanda con un punteggio aggregato. Registrala per corsa. Un'escursione con un record di copertura Inizia con un piccolo disco senza contenuti. Conservare identificatori o hash che permettano a un operatore autorizzato di trovare le prove sottostanti; non copiare in un nuovo negozio sanitario le indicazioni, gli argomenti degli strumenti, i segreti o i modelli di uscita. Ogni campo risponde a una decisione: 1. Può l'operatore recuperare la telemetria corrente? Testare la connessione Application Insights e l'effettiva autorizzazione alla query. Un caricamento della pagina del portale non è il test. 2. È la traccia sufficientemente fresca per questo flusso di lavoro? Non riutilizzare in silenzio il green span di ieri. 3. Che sta facendo l'agente? Preserva working , waiting , succeeded , e stati di guasto. Un nome di approvazione o di dipendenza esterna è un'attesa, non un blocco. 4. Ha coperto questo corso l'evaluatore richiesto? Copertura del negozio separatamente dal risultato dell'evaluatore. 5. Si è verificato il risultato promesso? Inqueri la destinazione che possiede il risultato. Il controllo dei risultati deve corrispondere al lavoro. Per un rapporto generato, verificare l'esistenza dell'oggetto atteso e la correttezza del suo hash o schema. Per un aggiornamento del biglietto, leggere il biglietto e controllare la transizione prevista. Per una mutazione API, consultare la risorsa di destinazione piuttosto che fidarsi del successo dello scambio HTTP del client. Per un compito di codice, richiedere la differenza prevista più il risultato di costruzione o di prova pertinente. Questo record evita deliberatamente un campo universale di successo. Combinando prove diverse troppo presto è come la copertura sconosciuta diventa verde. Riproduci la decisione prima degli avvisi di cablaggio L'apparecchio utilizzato per questo articolo contiene otto run sintetici e nessuna credenziali, richieste o telemetria di produzione di Azure. Il suo classificatore valuta la visibilità prima dello stato di esecuzione, lo stato di esecuzione prima della qualità e la qualità prima dell'esito: L'esecuzione di node audit azure observability.mjs contro il dispositivo fisso ha prodotto otto abbinamenti e nessuna incompatibilità: Caso Evidenza sul lato azzurro Prove di destinazione Verdicto Connessione presente, richiesta rifiutata Non riesce a controllare la telemetria corrente Presente di ricevimento EVIDENCE UNAVAILABLE Antica traccia, tutti gli altri campi verdi Stale Presente di ricevimento EVIDENCE STALE Traccia fresca, funzionamento attivo Attività attuale Non previsto ancora WORKING Traccia fresca, attesa di approvazione denominata Attuale attesa Non previsto ancora WAITING Esercizio riuscito, valutazione richiesta saltata Mancanza di copertura di qualità Presente di ricevimento QUALITY UNKNOWN Esecuzione riuscita, campionamento eval fallito Qualità fallita Presente di ricevimento QUALITY FAILED Esecuzione e valutazione riuscita Completato in fonderia In assenza di ricevuta FALSE COMPLETE Esecuzione e valutazione riuscita Completato in fonderia Presente di ricevimento HEALTHY Due risultati sono facili da gestire male. QUALITY UNKNOWN non è un valutatore fallito. Si dice che l'evaluatore non ha coperto la durata richiesta per questa decisione. Potete indirizzare tale stato a un sostituto deterministico, una valutazione unilaterale se del caso, o una revisione umana. Non è possibile rietichettare il punteggio aggregato del cruscotto come risultato di questa corsa. Anche la WAITING non è un fallimento. Se la traccia è fresca e identifica un proprietario legittimo e una dipendenza, l'azione utile è quella di far emergere l'attesa di quel proprietario. Ripartire l'agente può duplicare il lavoro o scartare il contesto senza risolvere la dipendenza. Impostare avvisi sulla condizione fallita, non il colore Un avviso deve indicare le prove che hanno rotto: Telemetria non disponibile : verificare la connessione Foundry to Application Insights, la query RBAC, l'accesso alla tabella protetta, gli strumenti e il traffico recente. EEvidenza stale : confronta l'ultimo tempo di tracciamento osservato con il budget di freschezza del flusso di lavoro e il ritardo noto nell'ingestione. Qualità sconosciuta : ispezionare il tasso di campionamento configurato e verificare se questa decisione richiede effettivamente un valutatore. Quality failed : conservare il nome dell'evaluatore, la versione, la soglia e l'identificatore della corsa testata prima di indagare. False complete : interrompere le riprovazioni automatiche al confine dell'effetto collaterale e conciliare la destinazione con un identificatore di lavoro stabile. Ciò produce operazioni più silenziose di un allarme su ogni campione mancante o di lunga durata. Le linee guida della scheda di controllo di Microsoft offrono ampie soglie di indagine, come l'analisi dei bassi tassi di successo di esecuzione o dell'elevata latenza. Questi segnali della flotta sono utili per trovare una coorte. Il record di copertura per esecuzione decide cosa c'è di sbagliato in un particolare pezzo di lavoro. Anche la freschezza ha bisogno di un proprietario. Application Insights controlla quanto tempo le prove rimangono consultabili; le autorizzazioni di ingestione e consultazione controllano se sono visibili ora. Immagazzinare separatamente l'ultimo tempo di interrogazione con successo e l'ultimo tempo di tracciamento corrispondente. Il pannello di controllo caricato non dimostra nulla. Mantenere visibile l' anteprima e i confini della privacy La documentazione attuale della fonderia segna parti del tracciamento e del monitoraggio degli agenti come preview. La Presentazione generale del tracciamento degli agenti dice che il tracciamento è generalmente disponibile per gli agenti prompt e ospitati mentre il tracciamento del flusso di lavoro e dell'agente esterno sono in anteprima. La guida di monitoraggio segna anche le caratteristiche del cruscotto come preview. Registrare il tipo di agente e lo stato delle funzioni nel runbook; non trasferire le garanzie da un percorso di agente ospitato a un flusso di lavoro esterno senza verificare il contratto in corso. Il tracciamento può catturare le richieste, le uscite, gli argomenti degli strumenti e i risultati degli strumenti. Microsoft consiglia di eliminare i contenuti sensibili prima di raggiungere la telemetria e di applicare controlli di accesso alla produzione e di conservazione. Se possibile, uno strato sanitario dovrebbe fare riferimento alle prove con identificatori privi di contenuto, non creare un secondo magazzino di carichi utili sensibili. C'è un'ultima limitazione da tenere al di fuori del verdetto: questo classificatore verifica la precedenza delle prove. Non contatta un abbonamento Azure, non deduce un obiettivo di livello di servizio di ingestione o non decide che successo significa per la tua applicazione. La ricevuta di destinazione è deliberatamente specifica per il carico di lavoro. Il punto è quel confine. L'osservabilità di Azure LLM può esporre l'esecuzione, le prestazioni, la qualità dei campioni e le prove di debugging. La salute operativa richiede anche freschezza, copertura, corretto stato di attesa e prova del risultato atteso. Sidewisp è attualmente in anteprima privata. La sua direzione è quella di trasformare le prove provenienti dai tempi di esecuzione degli agenti esistenti in una chiara visione della salute pur preservando l'incertezza e i limiti di approvazione umana; il monitoraggio di Microsoft Foundry non è presentato qui come un'integrazione Sidewisp spedita.