2026-08-01T01:57:57.589Z
Datadog LLM Esperimenti di osservabilità: Aggiungere una porta di promozione
Impressioni digitali del confronto, prova la copertura delle righe, conserva le attese valide e blocca gli effetti mancanti o duplicati prima della promozione.
Gli esperimenti di osservabilità Datadog LLM possono dirti che un candidato, un modello, un fornitore o un'architettura di agente ha ottenuto un punteggio migliore e ha funzionato più velocemente. Questa è una prova utile, ma non è ancora una decisione di rilascio. Il default ragionevole è confrontare il candidato e la linea di base all'interno dello stesso progetto Datadog, fissare la versione del set di dati, mantenere stabile le definizioni dell'evaluatore e ispezionare la distribuzione e le tracce piuttosto che fidarsi di una media. Poi aggiungere un piccolo cancello promozionale al di fuori della scheda di punteggio: dimostrare che ogni record richiesto è stato eseguito, le aspettative attese sono rimaste in attesa, i casi mutanti hanno prodotto esattamente un effetto, e i casi completati hanno una ricevuta di destinazione. In questo articolo l'ultimo passo viene attuato con un dispositivo di otto registrazioni. Il candidato passa il tasso di passaggio dell'evaluatore da 75% a 100% e la durata media da 980 ms a 738,75 ms . La promozione è ancora bloccata. Una restituzione non ha ricevuta di destinazione verificata e una cancellazione ha prodotto due effetti. Provi prima che i due esperimenti siano comparabili. La panoramica degli esperimenti di Datadog descrive tre operazioni fondamentali: set di dati di versione, eseguire esperimenti e confrontare i risultati. L'attuale documentazione di installazione definisce un esperimento come un compito eseguito sequenzialmente attraverso i record di set di dati, con valutatori di record e valutatori di riassunto opzionali. Gli interni delle attività possono utilizzare gli stessi decoratori di tracciamento del codice di produzione. Quegli primitivi ti danno un buon materiale per un confronto. Non rimuovono la necessità di definire ciò che deve rimanere identico tra le due piste. Prima di guardare i punteggi, registrare un manifesto senza contenuti: I hash identificano il codice dell'evaluatore; non sono hash di richieste, uscite, credenziali o dati dei clienti. Hash la serializzazione canonica JSON di questo manifesto e allegare l'impronta digitale a entrambi i record dell'esperimento. Il dispositivo produce: Se le impronte digitali differiscono, smettila di chiamare il risultato un confronto a coppia. Una versione modificata del set di dati può aggiungere casi difficili. Un valutatore modificato può spostare la soglia. Un record mancante può migliorare la media rimuovendo il fallimento che conta. Tali modifiche possono essere legittime, ma richiedono una nuova linea di base. passaggio del prodotto di Datadog dice che i set di dati supportano il controllo delle versioni e possono essere collegati a versioni specifiche. Spiega inoltre che la superficie di confronto espone le medie, le distribuzioni, la latenza, il costo, il numero dei token, le uscite e le tracce di span. Utilizzare tutto questo. Il manifesto non sostituisce le prove di Datadog; previene la deriva accidentale del confronto prima di interpretarlo. Eseguire un gate che può essere in disaccordo con le medie L'artefatto ispezionabile per questo articolo è uno script Python di biblioteca standard. Contiene otto dischi sintetici, privi di contenuti e emette JSON. Fate partire con: La regola fondamentale è deliberatamente piccola: Ciò non chiede a un secondo modello se il primo modello abbia avuto successo. Controlla i campi espliciti il cui significato controlli. Le prestazioni dell'apparecchio completo: Misurazione Linea di base Candidato : : Documenti presenti 8/8 8/8 Rate di passaggio dell'evaluatore 75% 100% Durata media 980 ms 738,75 ms Blocco delle registrazioni — 2 Decisione di promozione — Block La Guida per gli sviluppatori di valutazione di Datadog supporta i risultati dei valutatori digitati, una valutazione facoltativa di passaggio/fallo, metadati, tag e valutatori di sintesi. Ciò rende un valutatore una fonte adatta per evaluatorPass . Non rende ogni valutatore un verificatore di destinazione. Se il tuo valutatore confronta il testo generato con una risposta attesa, può passare mentre il rimborso non raggiunge mai il libro maggiore. Tenete queste vie di prova separate: E corsia di valutazione: La produzione soddisfava la regola di qualità scelta? Trace lane: Quale LLM, step di recupero, strumento e attività è stato eseguito, e con quali errori o latenza? Linea di Stato: Il caso era funzionante, in attesa legittima, completo, incerto o in necessità di una persona? EEffect lane: La mutazione esterna prevista è avvenuta esattamente una volta? OL'uscita: Il destino contiene ora il risultato promesso? Le prime due corsie sono le entrate naturali degli esperimenti Datadog. Le altre corsie provengono dal contratto di lavoro, dalle apparecchiature e dai sistemi di destinazione. Puoi presentare i loro risultati come valutazioni personalizzate o metadati sperimentativi, ma definirli al confine che possiede la verità. Le due registrazioni bloccate rivelano fallimenti diversi Il record issue refund ha un valutatore di passaggio, uno stato complete e un effetto tentativo. Il suo outcomeReceipt è missing . Ciò non dimostra che la restituzione non sia riuscita, ma che il completamento non è stato verificato. Il verdetto sicuro è uncertain , non verde e non un nuovo tentativo automatico. Il registro cancel subscription ha un valutatore di passaggio e una ricevuta di destinazione verificata, ma effectCount è due. Un stato finale di successo non cancella l'effetto duplicato. Il candidato è bloccato perché il cambiamento indebolisce l'effetto di sicurezza anche migliorando il punteggio aggregato. Il registro approval required dimostra il confine opposto. Il suo stato previsto è waiting , e il candidato fornisce un token di proprietario, scadenza e ripresa. Passa. Una pausa con una dipendenza nota non è una stallo, quindi un cancello che richiede che ogni riga finisca in complete punirebbe il comportamento corretto. Questi casi sono intenzionalmente inconvenienti. Se un gate di promozione ripete solo il punteggio dell'evaluatore, non può modificare la decisione di rilascio. Un cancello utile deve essere in grado di dire: il confronto è invalido perché la copertura registrata è cambiata; il candidato è migliore in termini di qualità ma non sicuro in termini di effetti; il candidato è più veloce ma ha lasciato un risultato sconosciuto; l'attesa è valida e non deve essere considerata un fallimento; Le prove sono in conflitto, quindi una persona deve decidere. Attaccare il cancello ad un vero esperimento Datadog L'attuale guida di configurazione di Datadog richiede ddtrace =4.3.0 per il percorso di Python Experiments documentato e richiede sia una chiave API che una chiave applicazione. Conservare questi segreti nelle variabili ambientali; non metterli in un manifesto, una riga di set di dati, un artefatto di articolo o un attributo traccia. Per un flusso di lavoro esperimento esistente, aggiungere il gate in cinque passaggi limitati. 1. Congelare il contratto di confronto. Registrare il progetto Datadog, l'identità e la versione del set di dati, gli ID dei registri ordinati, gli hash del codice di valutazione, la revisione delle attività, la configurazione dei candidati e lo stato atteso per ogni record. Conservare solo ID opachi o hash quando il contenuto è sensibile. 2. Conciliare la copertura prima di calcolare un tasso. Confrontare i dati di registrazione attesi con i dati di sperimentazione osservati. Le ID mancanti, duplicate o inaspettate non sono comparabili. Non ridurre silenziosamente il denominatore alle righe che sono ritornate. 3. Emettere campi deterministici al limite del compito. Per un compito solo da lettura, la ricezione può essere una risposta schema valevole legata alla revisione della fonte attesa. Per un compito mutante, utilizzare una chiave di idempotency, un'identità di effetto e una ricerca sul lato della destinazione. Contare gli effetti commessi, non riprovare. 4. Conservare gli stati non terminali. Un caso in attesa ha bisogno di un motivo, di proprietario, di scadenza e di identità di ripristino. Un caso di credenziali può terminare correttamente come needs human . Non inventare una risposta per rendere più facile un punteggio offline. 5. Promuovere solo in connessione. Il candidato può essere promosso quando il manifesto corrisponde, la copertura è completa, passano i valutatori richiesti, i budget operativi si mantenono, ogni stato corrisponde al suo contratto, ogni risultato completato è verificato e ogni caso mutante ha esattamente un effetto previsto. Una media ponderata non è un sostituto perché un punteggio elevato può compensare matematicamente un singolo effetto catastrofico. Una politica pratica è: Alineare le soglie per le metriche di qualità, la latenza e il costo di consulenza. Tenere le ricevute mancanti, gli effetti duplicati, l'esposizione segreta e i confronti non validi come fallimenti difficili a meno che il tuo dominio non fornisca una regola esplicita più sicura. Sappiate cosa non dimostra questa revisione Il dispositivo dimostra i suoi otto casi e l'attuazione della regola. Non dimostra che il tuo set di dati rappresenti il traffico di produzione, che le uscite attese siano corrette, che gli hash dell'evaluatore corrispondano al codice rivisto o che le ricevute di destinazione non possono essere falsificate. Inoltre non misura la qualità dei prodotti di Datadog né confronta i modelli. Tali domande richiedono la revisione dei set di dati, il controllo delle fonti, i controlli di accesso, il campionamento della produzione e la conciliazione con la destinazione reale. Gli esperimenti Datadog rimangono il luogo per studiare le corse degli esperimenti, le distribuzioni, le tracce e i risultati degli valutatori. La porta promozionale aggiunge una decisione operativa più ristretta: questo specifico confronto è sufficientemente completo e sicuro per autorizzare la modifica? L'orientamento del prodotto di Sidewisp è quello di rendere più facile l'interpretazione delle prove, dell'incertezza e della verifica sulla salute degli agenti nei tempi di esecuzione esistenti. Non sostituisce Datadog, il tempo di esecuzione o il processo di rilascio. Sidewisp è attualmente in anteprima privata. Il sito pubblico e la dimostrazione interattiva sono in diretta; la raccolta dell'agente di produzione e della salute e l'integrazione di Datadog non vengono generalmente spedite.