2026-08-01T12:22:43.984Z
Grafana LLM Osservabilità: dimostra il livello di risultato
Implementa i percorsi di generazione e OpenTelemetry di Grafana, quindi controlla il tempo di esecuzione, l'attesa, l'effetto e le prove di destinazione prima di chiamare un agente sano.
L'osservabilità di Grafana LLM può fornire un forte resoconto delle chiamate di modello, delle generazioni di agenti, delle tracce, dell'attività degli strumenti, della latenza, dei token, dei costi e delle valutazioni. Essa non può, da sola, dimostrare che un agente era raggiungibile quando previsto, attese la persona giusta, applicò un effetto esterno esattamente una volta, o produsse il prodotto richiesto. Il default pratico è quindi di due parti: utilizzare Grafana per la telemetria che documenta, quindi aggiungere un piccolo contratto di prova operativa per le domande che la telemetria non risponde. Prova queste parti separatamente. Una conversazione che appare a Grafana non è la prova che le tracce e le metriche siano arrivate, e una traccia pulita non è la prova che la destinazione sia cambiata. Questa guida implementa questo limite contro la documentazione corrente di Grafana e il pacchetto JavaScript @grafana/agento11y . Esso comprende anche un audit di sette casi che rende eseguibile la regola di accettazione piuttosto che lasciarla come consiglio di pannello. Inizia con il percorso documentato, poi testalo a pezzi Grafana espone attualmente due rotte correlate. Il suo generale AI Impostazione di osservabilità invia tracce, metriche e registri OpenTelemetry attraverso il gateway OTLP di Grafana Cloud per impostazione predefinita; un Collector OpenTelemetry o Grafana Alloy è l'alternativa documentata quando è necessario un routing, una trasformazione o un migliore controllo a un volume maggiore. La sua nuova superficie Osservabilità dell'agente aggiunge generazioni orientate all'agente, conversazioni, chiamate agli strumenti, passaggi di flusso di lavoro, token e dati sui costi, valutazioni e integrazioni di framework. Per JavaScript, il pacchetto corrente è @grafana/agento11y . L'etichetta npm latest ha restituito la versione 0.9.0 quando è stata controllata il 27 luglio 2026. Tratta questo come un'istantanea di implementazione datata, non una raccomandazione di versione permanente. L'inizio più breve documentato sembra così: Quindi configurare l'SDK a partire da variabili ambientali piuttosto che mettere un token di accesso nella fonte: I nomi delle variabili ambientali pertinenti sono documentati come AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID e AGENTO11Y AUTH TOKEN . Non stampare i loro valori nei registri o attaccarli alle tracce. C'è un confine facile da perdere nella Guida di strumentazione JavaScript di Grafana: l'esportazione di generazione e l'esportazione di OpenTelemetry non sono lo stesso percorso. L'SDK può inviare dati di generazione, ma ha bisogno di un TracerProvider e MeterProvider configurati per l'applicazione per esportare gli intervalli e le metriche che emette. Senza questi fornitori, la guida dice che le tracce e le metriche sono silenziosamente perse. Questo rende una conversazione visibile un test di configurazione debole. Utilizzare invece tre sonde indipendenti: 1. Crea una generazione con un ID di prova unico e trovala in Conversations . 2. Trova uno spazio con lo stesso identificatore di correlazione nella fonte di dati delle tracce. 3. Inquire una metrica emessa dal SDK nella finestra di prova e confermare i suoi attributi di risorse per identificare il servizio e l'ambiente atteso. Fallimento dell'installazione se manca una sonda. Non mettere in media i tre in un punteggio confortevole: generation=yes, trace=no, metric=no è una telemetria parziale, non un'installazione prevalentemente sana. Una traccia completa di Grafana è ancora prova di attività Grafana documenta una copertura utile. Agent Observability può catturare generazioni, chiamate di strumenti, passaggi di flusso di lavoro, latenza, errori, token, costi, punteggi di qualità e confronti di versioni. Questi segnali possono rispondere a domande come: La chiamata LLM ha fallito o si è rallentata? Quale modello e quale versione dell'agente ha gestito la fuga? Quali strumenti furono utilizzati, e in che traccia? Quanti token e quanto costo attribuito la corsa ha consumato? Una valutazione configurata o una guardia ha prodotto un punteggio? La OpenTelemetry convenzioni di agenti GenAI dà a quell'attività un vocabolario portatile. Al momento della ricerca, le convenzioni degli agenti erano esplicitamente contrassegnate allo stato di sviluppo e comprendevano operazioni per invocare un agente o un flusso di lavoro, pianificare e eseguire uno strumento. Lo stato dello sviluppo è importante: fissare la versione di strumentazione e aspettarsi che gli attributi o le forme di intervallo si evolvano. Nessuno di quei nomi definisce il tuo risultato aziendale. Un intervallo execute tool può segnalare una risposta HTTP di successo mentre il provider applica la richiesta in modo assincrono, la respinge dopo la convalida o scrive all'oggetto sbagliato. Un intervallo di flusso di lavoro completato può coesistere con un file mancante. Una valutazione della qualità può segnare il testo generato mentre una corsa programmata non è mai iniziata. Utilizzare una mappa delle prove che indichi sia la prova che il suo confine: Aereo di prova Può stabilire Essa non stabilisce Sonda di rilascio Esportazione di generazione Una generazione di modelli registrata ha raggiunto l'Agent Observability Tracce e metriche sono state esportate Trova un ID di conversazione unico Tracce Operazioni strumentali e loro percorso causale La destinazione esterna ha ora lo stato previsto Interrogare la durata correlata Metrici Segnali aggregati di tasso, durata, errore, token e costi Un'esercizio o un'operazione di consegna richiesto ha avuto successo Chiedi la finestra esatta di prova Valutazione Un punteggiatore di nome ha affrontato il materiale fornito Accettazione di un'affermazione di destinazione deterministica Conservazione della versione del punteggio e del campo di applicazione dell'input Racconto per il tempo di esecuzione Il tempo di esecuzione era raggiungibile e fresco all'orario previsto Completato il compito Confronta l' età del battito cardiaco con la sua SLA Aspetta il ricevimento Una pausa ha un motivo, un proprietario, una scadenza e un manuale di ripresa Il proprietario deciderà in tempo. Verificare il percorso e l'escalation Rispetto di effetto Un'operazione esterna può essere riconciliata Il risultato completo dell'utente è presente Leggi con l' ID di funzionamento stabile Ricevimento dei risultati Accettazione di un'affermazione specifica della destinazione Stabilità futura Ricontrollare durante una finestra di stabilità Questo non è un argomento per caricare più contenuti. Preferire ID, timestamp, versioni, stati a bassa cardinalità, hash, conteggi e affermazioni di destinazione rispetto alle richieste grezze, ai completi, ai carichi utili degli strumenti, ai segreti o ai percorsi di file. La ricca telemetria e la minimizzazione dei dati sono compatibili quando il contratto è progettato prima dell'istrumentazione. Eseguire l'audit di copertura su sette casi Ho convertito la mappa in una piccola deterministica. Ogni caso registra se la generazione, il tracciamento e l'esportazione metrica hanno avuto successo; se la telemetria e il battito cardiaco del runtime sono freschi; se la corsa ha una legittima attesa; se un effetto esterno è stato riconciliato; e se il risultato previsto ha un ricevimento autorizzato. Il classificatore applica la priorità piuttosto che l'aritmetica: Le sette apparecchiature coprono: nessuna generazione è arrivata; la generazione è arrivata, ma gli intervalli e le metriche non sono arrivati; tutte le telemetriche esistono ma sono obsolete; l'agente attende legittimamente con un proprietario, termine e token di ripresa; un tentativo di utilizzare uno strumento non ha alcun effetto di riconciliazione; le prove di telemetria e di strumenti sono verdi, ma manca il consegnabile; lo stesso caso completato ha una ricevuta autorizzata di consegna. Il replay locale ha superato tutte le sette classifiche attese: Il confronto più utile è tra gli ultimi due casi. Entrambe hanno generazione, traccia e esportazione metrica. Entrambi sono freschi. Entrambe segnalano il completamento della corsa e l'effetto dello strumento verificato. Il primo non ha alcuna affermazione di destinazione ed è classificato false success ; il secondo aggiunge object:report 17 più un hash di contenuto e diventa verified . Questo cambiamento è intenzionalmente ristretto. Nessun pannello di pannello, conteggio dei token, punteggio del modello o modifiche dello stato di traccia. Solo le prove richieste dalla richiesta dell'utente cambiano. L'audit ha una dura limitazione: si affida ai fatti che gli sono stati forniti. Un collezionista malintenzionato o rotto può mentire, e un ricevimento dalla destinazione sbagliata non è prova. Nella produzione, generare ricevute di risultato al confine autorizzato: una lettura dopo la scrittura del storage, una query di restrizione del database, una sonda di salute della distribuzione, una ricerca del fornitore di messaggi inviati o un'altra affermazione deterministica legata all'ID di lavoro originale. Trasformare la copertura in una porta di accettazione della produzione Eseguire un canario strumentale prima di abilitare una nuova versione dell'agente, l'integrazione del framework, il percorso del collettore o la modifica del campionamento. Date al canario un'identità di lavoro unica e un risultato atteso innocuo. Quindi richiedere tutte le affermazioni applicabili: Generation: la generazione esiste sotto l'ID canario. Trace: la durata della radice e le operazioni di bambino richieste sono consultabili. Metric: la finestra canaria contribuisce alla serie attesa. Freshness: ritardo del collezionatore rimane inferiore a un limite dichiarato. Runtime: un ricevimento di battito cardiaco o di programmazione dimostra che il tempo di esecuzione è stato raggiungibile quando previsto. Attende: ogni pausa indica la sua ragione, il proprietario autorizzato, la scadenza della decisione, il percorso di escalation e la gestione della ripresa. Eeffetto:Le operazioni con effetti collaterali di si conciliano con un idempotenza stabile o un ID operativo del fornitore. Outcome: un controllo di destinazione autorizzato dimostra l'esistenza dell'artefatto o dello stato richiesto. Privacy: la query di prova conferma che i campi proibiti di prompt, risposta, segreto e percorso sono assenti. Tenete i verdetti inconvenienti. telemetry partial dovrebbe bloccare il lancio di strumenti. health unknown dovrebbe impedire un status verde quando le prove sono obsolete. waiting dovrebbe informare il proprietario senza ricominciare il lavoro legittimo. uncertain effect dovrebbe fermare i ripeti tentativi ciechi. false success deve riaprire l'attività o l'incidente anche quando la traccia è terminata normalmente. Il campionamento ha bisogno di una decisione separata. Le tracce pesanti possono essere prelevate quando il volume ne ha bisogno, ma le ricevute di salute compatte necessarie per classificare una corsa richiesta non dovrebbero scomparire con loro. Conservare identificatori sufficienti a correlare tracce campionate con ricevute di esecuzione, attesa, effetto e risultato non campionate. Altrimenti una politica di telemetria più economica diventa silenziosamente una politica di correttezza più debole. C'è anche un costo operativo. Le letture di destinazione aggiungono latenza e chiamate del fornitore; i battiti cardiaci di runtime aggiungono controlli di stoccaggio e freschezza; le ricevute di attesa richiedono la proprietà del routing. Applicare il più piccolo controllo deterministico che risolva la decisione. Una verifica dell'esistenza del file e dell'hash è meglio che chiedere ad un altro modello se il file probabilmente esiste. Un giudice LLM rimane utile quando il risultato è semantico, ma registra la sua versione, rubrica, portata di input e incertezza accanto ai controlli deterministici. Dove si inserisce Sidewisp Grafana è un luogo capace di ispezionare e correlare la telemetria. Il livello mancante descritto qui è il giudizio operativo sulla raggiungibilità, sul progresso, sull'attesa, sugli effetti e sui risultati non un altro visitatore di tracce. Sidewisp è destinato a diventare uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti, con prove esplicite, freschezza, incertezza, limiti di omologazione e verifica. Non si tratta di una sostituzione del tempo di esecuzione o di un gateway modello obbligatorio. Gli adattatori per il monitoraggio della produzione e il recupero non vengono spediti oggi. Sidewisp è attualmente in anteprima privata. Se questo limite di prova corrisponde al modo in cui si gestiscono gli agenti, il passo successivo appropriato è quello di unirsi alla lista di attesa di anteprima privata e descrivere i controlli di tempo di esecuzione e risultati di cui hai bisogno. Fino ad allora, mantenete i verdetti telemetrici di Grafana precisi e accoppiate il completamento alla prova di destinazione che il vostro lavoro richiede effettivamente.