2026-07-31T20:58:41.899Z

Splunk LLM Osservabilità: mantenere le chiamate del valutatore fuori dall'agente salute

Audit Splunk isolamento del valutatore, telemetria dell'istogramma, copertura del campionamento, cardinalità, cattura del contenuto e prova dei risultati prima di affidarsi a una visione dell'agente verde.

L'osservabilità di Splunk LLM può mostrare prestazioni utili, qualità, token, costo stimato e prove di traccia per un agente strumentale. Il default operativo sicuro, tuttavia, non è la pagina AI Agents è popolata, quindi l'agente è sano. Provi prima che il pipeline di misurazione sia completo, che le chiamate dell'evaluatore non siano considerate come attività di applicazione, che la copertura della valutazione abbia un denominatore noto e che il risultato richiesto esista al di fuori della traccia. Questa guida costruisce quella prova senza raccogliere richieste o risposte. Il sistema di otto casi inclusi produce un ricevimento senza contenuti e le rotte correntano ciascuna verso uno di questi stati: ingestione incompleta, contratto metrico non corrispondente, auto osservato dall'evaluatore, rischio di alta cardinalità, revisione della politica di contenuto, copertura di valutazione scesa, osservabile ma non verificata, o sana con prove coperte e verificate. Controllare il percorso di misurazione prima di leggere il punteggio La documentazione di configurazione di Splunk rende due dettagli telemetrici operativamente importanti. In primo luogo, sono necessarie metriche di istogramma per le pagine di monitoraggio degli agenti AI. Quando si utilizza l'esportatore SignalFx, l'impostazione del collezionatore documentato è send otlp histograms: true . La configurazione specifica anche la temporalità delta attraverso: Una traccia visibile non dimostra che questo percorso metrico sia corretto: gli intervalli e gli istogrammi possono fallire in modo indipendente. In secondo luogo, la strumentazione Python AI può eseguire valutazioni nello stesso processo dell'applicazione. Splunk documenta questo switch, il cui default è falso: In tale modalità predefinita, le chiamate LLM effettuate da valutatori come DeepEval possono essere strumentalizzate insieme alle chiamate di applicazione. Impostare le valutazioni in esecuzione vera in un processo per bambini con il SDK OpenTelemetry disattivato, impedendo che le chiamate dell'evaluatore contaminino la telemetria delle applicazioni. Splunk segna questo isolamento come richiesto per la strumentazione OpenAI quando le valutazioni sono abilitate e facoltative per altri quadri documentati. Questa distinzione cambia il significato di un grafico. Supponiamo che un agente invoca un modello due volte, poi un valutatore fa altre tre chiamate modello. Se l'evaluatore condivide il processo strumentale, un aggregato ingenuo può riportare cinque chiamate, i loro token combinati e la loro latenza combinata. L'attività aggiuntiva è un vero calcolo, ma non è la prova che l'agente abbia fatto più progressi. Si tratta di un lavoro di misurazione che osserva il lavoro di misurazione. Registrare una ricevuta senza contenuti per distribuzione: Nessuno di questi campi ha bisogno di un prompt, risposta, argomento strumento, segreto, o identificatore del cliente. Descrivono la salute della pipeline di prove. I primi tre controlli rispondono a domande diverse: histogramsExported : il collezionista ha esportato la telemetria dell'istogramma richiesta dalle pagine di monitoraggio AI? deltaTemporality : il contratto di metriche corrisponde alla configurazione documentata? aiSpanVisible : almeno una nuova span di GenAI ha raggiunto la vista Splunk prevista? Non collassare questi in una sola telemetry ok boolean. Se arrivano gli intervalli ma gli istogrammi non lo fanno, l'indagine delle tracce può funzionare mentre i pannelli aggregati rimangono incompleti. Se i dati sono vecchi, una pagina popolata può ancora essere obsoleta. Tenere la fonte delle prove e il tempo di osservazione accanto alla ricevuta in un'implementazione reale. Date a ogni punteggio di qualità un denominatore di copertura Splunk descrive un punteggio di qualità dell'agente AI come la percentuale di valutazioni passate per una metrica. La sua documentazione AI Agents dice che gli intervalli sono campionati per calcolare quei punteggi, e un punteggio inferiore all'80% segna un problema di qualità. Questa può essere una regola utile per il campione valutato. Non è, di per sé, la prova che ogni invocazione ammissibile sia stata valutata o che il campione rappresenti ogni tipo di attività. Traccia quattro numeri insieme: 1. i termini di applicazione ammissibili; 2. tasso di campione di valutazione configurato; 3. i risultati della valutazione completati; 4. riduzioni della coda di valutazione. Per una finestra di controllo deterministica, calcolare: Con 400 intervalli ammissibili, un tasso di campionamento di 0,25, 100 valutazioni e scarsezza zero, la copertura osservata è del 25% e corrisponde all'aspettativa configurata. Quindi Znot significa che gli altri 300 spans sono passati. Significa che il loro stato di valutazione è al di fuori del campione. La configurazione Python di Splunk espone anche una dimensione della coda di valutazione. Un limite positivo si applica alla contrapressione; quando la coda è piena, vengono scaricati nuovi oggetti con un avvertimento. La documentazione raccomanda un limite nell'intervallo 1001000 a seconda del throughput e della memoria, mentre lo zero o lo unset lascia la coda illimitata. Le scelte hanno un compromesso: una coda illimitata può trasformare il ritardo di valutazione in pressione di memoria; una coda limitata può preservare il processo ma ridurre la copertura della valutazione; un contatore a caduta in coda di sei significa che 94 valutazioni completate non possono onestamente sostituire 100 valutazioni ammissibili ad un tasso di campione del 100%. L'audit restituisce quindi EVALUATION COVERAGE DROPPED , non sano e non agente fallito. L'agente potrebbe aver completato un lavoro utile; le prove necessarie per il verdetto qualitativo sono incomplete. Le dimensioni metriche hanno bisogno di un confine simile. Splunk consente di copiare gli attributi di contesto di GenAI nelle dimensioni metriche, ma avverte esplicitamente che gen ai.conversation.id può causare problemi di alta cardinalità. Mantenere l'identità per conversazione in intervalli quando è necessario per la diagnosi. Non trasformarlo automaticamente in dimensione metrica. Un ambiente di distribuzione a bassa cardinalità o un livello di inquilini è di solito più sicuro per l'aggregazione; il set corretto dipende comunque dal traffico e dai limiti di inquilini. Tenere contenuti catturare un'eccezione esplicita La documentazione del servizio LLM di Splunk dice che la raccolta di richieste e risposte è disattivata per impostazione predefinita e avverte che il contenuto può contenere informazioni sensibili o di identificazione personale. Il suo percorso di configurazione osserva anche che i grandi input e output catturati possono superare i limiti di backend e causare problemi di prestazione. Questa revisione non ha bisogno di contenuti. Può verificare l'esportazione dell'istogramma, la temporalità, l'isolamento del processo, il campionamento, le gocce, le dimensioni, la visibilità delle tracce e una ricevuta di destinazione utilizzando solo i metadati. Se un'indagine di qualità separata richiede veramente contenuti acquisiti, procedere a un riesame delle politiche di contenuto: identificare l'evaluatore esatto che ha bisogno di contenuti; indicare se la cattura si verifica su spazi, eventi o entrambi; conservazione, accesso, mascheramento e cancellazione dei documenti; il comportamento di prova in base alla dimensione del carico utile; verificare che le definizioni degli strumenti non siano catturate semplicemente perché la cattura dei messaggi è stata abilitata; disabilitare la cattura dopo l'indagine limitata se la raccolta continua non è giustificata. L'apparecchio restituisce CONTENT POLICY REVIEW quando la cattura è abilitata senza ricevuta di omologazione. Questo verdetto non è intenzionalmente sano né infranto. Dice che lo strumento ha superato un limite di dati che il controllo sanitario non può autorizzare. La stessa limitazione si applica al costo stimato. Splunk afferma che la stima dei costi degli agenti moltiplica i costi dei fornitori pubblicati con i numeri dei token disponibili e non rappresenta una fatturazione effettiva. Etichettare la stima, conservare la data di fissazione dei prezzi e non riconciliarla silenziosamente con una fattura o uno sconto in cache specifico per il fornitore. Eseguire l' audit delle prove su otto casi L'artefatto riproducibile utilizza una regola di priorità. I risultati precedenti bloccano gli stati verdi successivi: Eseguire l' attrezzatura salvata: Riproduce otto casi e restituisce otto risultati distinti: coperto e verificato HEALTHY COVERED VERIFIED : Telemetria richiesta, campione dichiarato, gocce zero e accordo di risultato. evaluatore autoosservato EVALUATOR SELF OBSERVED : Le chiamate dei giudici possono essere inserite nella telemetria delle applicazioni. istogrammi mancanti INGESTION INCOMPLETE : Una traccia non dimostra l'arrivo delle metriche richieste. ZTemporalità errata METRIC CONTRACT MISMATCH : Il contratto metrico esportato differisce dalla configurazione documentata. conversazione id as metric HIGH CARDINALITY RISK : Per conversazione l'identità è stata promossa in una dimensione metrica. contenuto catturato non esaminato CONTENT POLICY REVIEW : Un confine dei dati sensibili è stato superato senza ricevimento. Valuation queue dropped EVALUATION COVERAGE DROPPED : 94 risultati non possono rappresentare un previsto 100. trace without outcome OBSERVABLE NOT VERIFIED : Esistono prove di esecuzione, ma il risultato promesso non lo è. Si tratta di un audit di configurazione sintetica, non di un test di conformità di Splunk. Non può dimostrare che un collezionista è raggiungibile, che un ruolo include la capacità richiesta, che la conservazione copre una finestra di incidente o che una destinazione contiene il consegnabile atteso. Rimpiazzare i valori dei dispositivi con osservazioni provenienti dall'ambiente e conservare unknown quando un valore non può essere misurato. Fermare la traccia prima del verdetto sanitario La traccia di Splunk e le visualizzazioni di interazione AI rispondono a domande importanti sulle operazioni del modello, gli errori, l'uso dei token, la latenza e la qualità della risposta valutata. Un verdetto contro l'agente sanitario ha un altro limite: il lavoro richiesto è stato eseguito? Scegliere il controllo deterministico di destinazione più forte disponibile: un file esiste nel percorso previsto e corrisponde a uno schema o a un hash; esiste una richiesta di pull presso il deposito previsto e il commit; esiste un messaggio nella destinazione prevista con la chiave di idempotenza prevista; una mutazione del database è visibile sotto l'identità di inquilino e di operazione prevista; una serie di prove superate con l'artefatto prodotto; Un'approvazione umana è ancora in sospeso, quindi la corsa è waiting , non fallita. Unisciti a quella ricevuta con un identificatore minimo di privacy. Tenere il contenuto disponibile alla fonte. Un intervallo di successo più una ricevuta mancante è OBSERVABLE NOT VERIFIED ; non è un permesso automatico per riprovare, perché l'effetto esterno potrebbe esistere ma essere temporaneamente illeggibile. La regola pratica è semplice: fidarsi della visione Splunk dopo che il suo percorso di misurazione passa, interpretare i punteggi di qualità entro la loro copertura conosciuta e chiarire la salute dell'agente solo quando il risultato previsto è verificato separatamente. La Sidewisp segue la stessa direzione del prodotto prima della prova: distinguere l'attività da un progresso utile, rivelare le prove mancanti e mantenere la verifica dei risultati separata dal completamento delle tracce. Sidewisp è attualmente in anteprima privata. Gli adattatori di monitoraggio della produzione e il motore di recupero non sono presenti qui come generalmente disponibili; il sito pubblico è un'esperienza di accesso precoce e una dimostrazione del prodotto. Fonti Configurazione AI Agente Monitoring, documentazione Splunk Observability Cloud. Configurare l'agente Python per le applicazioni AI 0.1.14 e superiori, documentazione Splunk Observability Cloud. Controllare gli agenti AI, aggiornato per l'ultima volta il 16 giugno 2026. Monitorare i servizi LLM, aggiornato per l'ultima volta il 12 maggio 2026.