2026-08-01T14:17:56.566Z
Metrici di valutazione dell'agente AI: cinque segnali, senza punteggio composto
Utilizzare cinque denominatori espliciti e porte di prova dura per confrontare i rilasci di agenti senza nascondere falso successo, effetti di strumento sconosciuti o fallimenti costosi.
Le metriche di valutazione dell'agente AI dovrebbero rispondere a una domanda di rilascio, non decorare una dashboard. Per un agente utilizzatore di strumenti, un default compatto è cinque misure tenute separate: qualità del compito, progresso utile, integrità dell'effetto dello strumento, costo per risultato verificato e tasso di errore di successo. Registrare la copertura delle prove accanto a ciascuno. Quindi rendere i risultati mancanti e gli effetti strumentali sconosciuti porte dure prima di ottimizzare le medie. L'ordine conta. Un candidato può scrivere una prose migliore, finire più velocemente e sembrare più economico per corsa mentre produce un prodotto non verificato. Mettere in media questi segnali in un punteggio trasforma un rilascio non sicuro in un miglioramento numerico. Tenere cinque denominatori invece di un punteggio La valutazione degli agenti ha più di un oggetto di interesse. Guida di ingegneria di Anthropic per le valutazioni degli agenti distingue tra attività, prove ripetute, gradori, trascrizioni e lo stato finale dell'ambiente. Il suo esempio di prenotazione di voli è il limite utile: la trascrizione può dire che un volo è stato prenotato, mentre il risultato è se la prenotazione esiste nel database. L'attuale Vertex AI descrizione della valutazione dell'agente fa un'altra separazione. La valutazione della risposta finale chiede se l'agente ha raggiunto l'obiettivo; le metriche di traiettoria esaminano il percorso, comprese le corrispondenze esatte o ordinate di azione, la precisione, il richiamo e l'uso di uno strumento. Entrambi i punti di vista sono utili, ma nessuno dei due dovrebbe silenziosamente sostituire l'altro. Utilizzare questo contratto di cinque metri: Metrica Numeratore Denominatore Conservare separatamente Rolo di rilascio Qualità delle attività Somma dei punteggi di qualità di rubrica o deterministica in versione Le prove per le quali il gradatore di qualità ha effettivamente corso Versione più ampia, copertura, disaccordo Ottimizzare dopo che le prove dure sono passate Progresso utile Finestre di osservazione attive con delta di prove specifici per attività Finestre attive osservate Finestre esplicite di attesa e collezionisti obsoleti Piano, quindi ottimizzare Integrità dell'effetto strumento Effetti esterni verificati al luogo di destinazione Tentativi di effetto verificati + falliti + sconosciuti Intenzionalmente rifiutate chiamate, effetti sconosciuti Pavimento duro Costo per risultato verificato Costi di esercizio totali coperti Risultati verificati in base alla destinazione Costito stimato, copertura mancata di fatturazione Piano di bilancio e ottimizzazione Tasso di fallimento Completamento dichiarato il cui controllo di risultato non è riuscito Tutti i completi dichiarati Completamenti il cui verificatore non era disponibile Difficile veto Ogni denominatore impedisce una menzogna diversa. La qualità media senza copertura graduale ricompensa gli esempi più facili. Il successo dello strumento senza prove di destinazione confonde una chiamata di successo con un effetto di successo. Il costo per corsa ricompensa i fallimenti a basso costo. Il tasso di completamento ricompensa l'agente per aver valutato il proprio credito. La telemetria operativa appartiene ancora al libro. Il OpenTelemetry Rapporto delle metriche GenAI incollato definisce gli strumenti di sviluppo per l'uso dei token, la durata dell'operazione, la durata dell'agente, il numero di chiamate di inferenza, il numero di chiamate degli strumenti e la durata degli strumenti. Queste misure spiegano il carico di lavoro e l'efficienza. Non affermano l'esistenza di un fascicolo, la creazione di una fattura una volta o l'arrivo di un rapporto di calendario alla destinazione. Prima di scegliere le soglie, scrivere la documentazione delle prove Inizia da una riga per processo. Non iniziare con un grafico aggregato. Un record minimo ha bisogno di informazioni sufficienti per riprodurre ogni numeratore, denominatore, esclusione e stato non disponibile: Il valore importante non è 0.90 ; è il disaccordo che lo circonda. Il gradatore di risposta ha apprezzato l'output, ma il verificatore di risultati non era disponibile e l'effetto dello strumento rimaneva sconosciuto. Questa prova potrebbe insegnarti sulla qualità della risposta. Non può sostenere una richiesta di rilascio. Utilizzare tre stati di prova ove sia possibile l'assenza: verified significa che il predicato denominato è andato contro la destinazione prevista e è passato. failed significa che il predicato è stato eseguito e che lo stato atteso è stato assente o inaccettabile. unavailable significa che nessun verdetto è stato possibile perché il verificatore, il collezionista, il permesso o le prove di destinazione mancavano. Non convertire unavailable in zero o con successo. Zero è una misura; non disponibile è un difetto di copertura. L'attesa ha bisogno di cure simili. Una corsa con un proprietario di approvazione esplicita, la decisione richiesta, la scadenza e lo stato di ripristino non è bloccato. Contare i progressi utili durante le finestre attive prima dell'attesa, quindi fermare l'orologio attivo. Tenere la chiamata di strumento ad alto impatto negato come prova che il limite ha funzionato; non considerare un rifiuto intenzionale come un fallimento dello strumento. La qualità dei compiti è l'unica metrica che potrebbe richiedere diversi tipi di grading. Utilizzare test deterministici per campi strutturati, file, file di database, stato HTTP e condizioni di politica esatte. Un model grader può valutare tono, rilevanza o un artefatto a termine aperto, ma immagazzinare il suo prompt, modello, versione rubrica e campione di calibrazione. La revisione umana rimane necessaria quando il giudizio è conseguente o non si comprende il tasso di disaccordo del modello di valutazione. Riproduce l'inversione del rilascio L'artefatto conservato con questo articolo contiene dieci prove sintetiche: cinque per stable v1 e cinque per fast v2 . Eseguire con Node.js 20 o più recente: Le soglie dichiarate sono: La sintesi esatta è: Variante Qualità Progresso utile Effetti degli strumenti verificati Costo / esercizio Costo / risultato verificato Falso successo Completamento non verificato Porta : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 Passaggio fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 FALLO Tre osservazioni modificano la decisione. In primo luogo, fast v2 sembra più economico quando il denominatore è in esecuzione: 0,38 dollari invece di 0,41 dollari. Una volta che la spesa è divisa per risultati verificati, la conclusione si inverte: 0,63 dollari invece di 0,52 dollari. La versione più veloce ha speso meno per ogni tentativo e più per ogni risultato di cui si poteva fidarsi. In secondo luogo, il punteggio di qualità superiore di 0,902 non ripara un risultato mancante. Una finitura lucidata non riuscì a verificare l'ambiente; un'altra non aveva un verificatore utilizzabile. Le medie di qualità e di progresso utile rimangono diagnostiche, ma non sono autorizzate a pubblicare, pagare, inviare messaggi, cancellare o accettare altrimenti un effetto esterno. In terzo luogo, la stable v1 contiene una legittima attesa di approvazione. Non è presente nel denominatore di qualità della prova completata, ma i progressi compiuti prima dell'attesa e la richiesta di strumento intenzionalmente rifiutata rimangono visibili. Il contratto metrico non ricompensa il teatro di completamento né punisce una pausa corretta. Questo esperimento è un controesempio, non un punto di riferimento. I prezzi, le prove e le soglie sono costruiti per testare la regola contabile. Non si stima un tasso di errore di produzione e $0.60 non è un bilancio universale. Prove di porta prima di ottimizzare la qualità Applicare le metriche in ordine fisso: 1. Check coverage. Ogni completamento dichiarato ha bisogno di un verdetto finale o di uno stato esplicito non disponibile. Ogni tentativo di uno strumento con effetto richiede prove verificate, fallite o sconosciute di destinazione. 2. Block falso successo. Se un completamento dichiarato non riesce a verificare il risultato, interrompere il rilascio. Investiga il predicato di completamento, non lo stile di risposta. 3. Block effetti sconosciuti. Un effetto collaterale sconosciuto è un limite di incidente. Chiedi la destinazione o concili una chiave di idempotency prima di riprovare. 4. Check progress and tool floors. Confronta attività simili e conserva le attese valide. Una regressione del progresso o un tasso di effetto strumento fallito possono giustificare un rallentamento anche quando la qualità finale aumenta. 5. O Ottimizzare la qualità e il costo. Solo ora confrontare i punteggi di rubrica, la latenza, i token e il costo per risultato verificato. Questo non è un composto ponderato. I pesi invitano a negoziare tra danni non correlati: una sufficiente fluenza può annullare matematicamente un doppio pagamento; un numero sufficiente di corse a buon mercato può nascondere un rapporto mancante. Una politica può ancora utilizzare pesi all'interno della rubrica di qualità delle attività, ma la copertura delle prove e gli effetti esterni rimangono al di fuori di tale punteggio. Scegliere le soglie dalle conseguenze e dal baseline del flusso di lavoro. Un agente di ricerca solo per lettura può tollerare un piano inferiore di effetto strumento perché la maggior parte delle chiamate sono reversibili. Una pubblicazione, una fatturazione, un messaggio al cliente o un agente di controllo dell'accesso dovrebbero richiedere ricevute di destinazione, idempotency e un obiettivo di falso successo zero per la suite di test coperta. Indicare gli intervalli di fiducia quando il numero di prove è sufficientemente grande e mostrare il numero grezzo quando non lo è. Cinque prove sono 0/5 , non prova di un tasso di insuccesso della popolazione zero. Tenere la valutazione e la salute della produzione connesse ma distinte. Le prove offline ti dicono se un candidato sopravvive a scenari noti. Il monitoraggio della produzione ti dice se gli orari reali, le credenziali, le dipendenze, i costi e i risultati rimangono sani dopo il rilascio. Una suite di passaggio è un permesso per la distribuzione nel campo di applicazione dichiarato, non una prova che le future esecuzioni non possono fallire. La direzione del prodotto di Sidewisp è quella di mettere risultati, progressi, strumenti, disponibilità, memoria e prove sui costi in una visione di salute intorno ai tempi di esecuzione degli agenti esistenti. Non si tratta di un sistema di sostituzione, di un gateway obbligatorio o di un fissatore autonomo. Sidewisp è attualmente in anteprima privata. Il sito pubblico e la libreria di articoli sono in diretta; la raccolta dell'agente di produzione sanità, gli adattatori di runtime, l'analisi dei costi dei token e l'esecuzione del recupero non vengono generalmente spediti. Utilizzare il contratto di cinque metri su un flusso di lavoro consecuente prima. Se la versione con la media più bella non riesce ancora a ottenere un risultato o un effetto strumento, le metriche hanno fatto il loro lavoro.