2026-08-01T11:10:49.188Z

Per una scienza dell'agente AI Affidabilità: audit delle prove

Trasforma le dodici metriche della carta in un profilo di prove ispezionabile, poi aggiungi le ricevute sanitarie in vivo di cui una decisione di dispiegamento ha ancora bisogno.

La breve lettura operativa di verso una scienza di AI Agente affidabilità è questa: mantenere il profilo quadridimensionale della carta, ma non accettare mai una fila di dodici punteggi senza le prove che le hanno prodotte. Per una decisione di distribuzione, aggiungere anche la prova attuale della raggiungibilità, delle operazioni attese, delle attese di proprietà, degli effetti degli strumenti e dei risultati di destinazione. Un profilo di riferimento e un verdetto sanitario in diretta rispondono a domande correlate ma diverse. La Giugno 2026 documento arXiv v3 di Stephan Rabanser e colleghi misura l'affidabilità indipendentemente dalla precisione delle attività grezze. Essa valuta 15 modelli su GAIA e un sottoinsieme pulito di τ bench, quindi decompone l'affidabilità in coerenza, robustezza, prevedibilità e sicurezza. Il risultato degli autori è deliberatamente inconveniente: i guadagni di capacità nel corso della finestra di rilascio studiata non hanno prodotto automaticamente guadagni di affidabilità comparabili. Questo è utile per un operatore, ma solo dopo aver tradotto ogni metrica in un contratto di prova. L'elenco di controllo di seguito rende tale la traduzione e rende esplicito il restante limite di produzione. Leggi le dodici metriche come richieste di prove La tabella 2 del documento contiene dodici metriche. Non sono dodici punti di qualità intercambiabili. Dimensione Metrici di carta Minime prove da conservare Consistenza risultato; distribuzione della traiettoria; sequenza della traiettoria; utilizzo delle risorse Versione del set di attività, conteggio indipendente di esecuzione, oracolo di risultato, sequenze di azione, unità di risorse e ogni record per esecuzione Robustezza difetto; ambiente; rapido Prova di base, prova di disturbo in coppia, specifica di perturbazione in versione e prova che l'ambiente o il cambiamento rapido hanno preservato il significato del compito Previsibilità calibrazione; discriminazione/AUROC; Brier Confidenza acquisita prima della classificazione, evidenza dei risultati binari, metodo di classificazione o di classificazione, numero di campioni e fonte di fiducia Sicurezza conformità; gravità del danno Restrizioni di versione, ogni violazione, regole di severità, identità e versione del giudice e un campione di validazione umana La prima regola operativa è quindi semplice: la metrica a senza denominatore, protocollo e posizione delle prove non è disponibile, non è bassa e non è sana . Considerate la coerenza dei risultati. Ripettere quaranta compiti cinque volte dà 200 prove, ma un punteggio da solo non ti dice se gli stessi compiti si alternano tra successo e fallimento o se un sottoinsieme fisso fallisce ogni volta. Tali modelli possono avere una precisione media simile e conseguenze operative molto diverse. La metrica della carta esiste per esporre tale distinzione; scartare le prove a livello di prova ricreerebbe il problema che risolve. Le metriche di robustezza richiedono ancora più attenzione. Un punteggio di iniezione di guasto è interpretabile solo rispetto a una linea di base. Un punteggio di robustezza immediata è valido solo se le varianti rimangono semanticamente equivalenti. Il rinominamento di un campo JSON può testare la fragilità ambientale; rimuovere le informazioni necessarie per risolvere il compito cambia il compito. Conservare il generatore di perturbazione, la sua versione e un campione rivisto accanto al risultato. La prevedibilità richiede un tempo simile. Capta la fiducia prima che il gradatore di risultati corra. La fiducia scritta dopo che un agente ha visto un risultato del test non è una previsione. Indicare anche se il valore proviene dall'agente, da un modello separato, da un classificatore calibrato o da un heuristico. I punteggi di calibrazione, AUROC e Brier possono essere calcolati correttamente dal segnale di fiducia sbagliato. Infine, conservare il limite di sicurezza della carta. Il suo metodologia pubblica segnala la sicurezza separatamente dal punteggio di affidabilità aggregato. Questa è la regola standard per le operazioni. Un punteggio di coerenza elevato non deve eliminare una azione distruttiva non autorizzata. La conformità misura la frequenza con cui i vincoli sono stati rispettati; la gravità del danno condizionale chiede quanto siano gravi le violazioni. Hai bisogno sia della frequenza che della coda. Lineazione del profilo prima di discutere le soglie Gli argomenti di soglia sono prematuri quando il pacchetto di prove è incompleto. Ho costruito un piccolo rivestimento di profilo che prima verifica la struttura: esistono tutte le dodici metriche denominate; ogni metrica ha un punteggio, un numeratore, un denominatore, un protocollo e un URI di prova; i risultati di robustezza includono i numeri di base e di perturbazione in coppia più una specifica di versione; i risultati di prevedibilità identificano la fonte di fiducia; i risultati di sicurezza identificano i vincoli e il metodo di valutazione; la sicurezza non è integrata nell'aggregato generale di affidabilità; un'implementazione autonoma include un campione di sicurezza non vuoto convalidato dall'uomo. Si verificano quindi sei classi di prove sanitarie: freschezza, accessibilità, copertura del programma, proprietà in attesa, ricevute sull'effetto degli strumenti e ricevute sul risultato della destinazione. Il profilo illustrativo incluso contiene tutte le dodici metriche di carta e una revisione della sicurezza umana di 30 casi. Il risultato è ancora: Ai due bloccatori mancano le ricevute per l'effetto strumento e per il risultato di destinazione. Il test del linter fornisce quindi questi due riferimenti alle prove e cambia il risultato in PASS . Questo non dimostra che l'agente immaginario sia sicuro; dimostra che il manifesto di prove è abbastanza completo da rivedere. La distinzione è importante. Eseguire l'audit con: E' un artefatto deliberatamente modesto. Convalida la presenza e la forma, non la validità scientifica. Non può decidere se un benchmark rappresenta i vostri utenti, se un rapporto di fiducia è onesto, se due richieste significano la stessa cosa, o se un giudice LLM ha valutato correttamente il danno. Questi restano compiti di revisione del dominio. Non trasformare il profilo in un solo numero di rilascio Il documento calcola gli aggregati di dimensioni per supportare il confronto, ma le sue scelte rivelano perché gli operatori dovrebbero mantenere il profilo visibile. L'aggregato di affidabilità complessiva combina coerenza, prevedibilità e robustezza; la sicurezza rimane separata. Il documento precisa anche limiti importanti: due parametri di riferimento coprono solo una piccola fetta di attività, un ecaldo viene utilizzato per ogni parametro di riferimento, la valutazione della sicurezza dipende da un giudice LLM, le scelte di metrica e di aggregazione sono soggettive e la temperatura zero può sopravvalutare l'affidabilità disponibile in impostazioni scelte per massimizzare l'accuratezza. Tali limiti dovrebbero apparire accanto a una decisione di distribuzione e non in una nota metodologica archiviata. Una revisione pratica può utilizzare tre strati: 1. Completità del profilo: Le dodici metriche sono supportate da prove verificabili? 2. Trivalori di applicazione: Quali dimensioni e condizioni di coda sono accettabili per questo compito e per questo livello di autorità? 3. OEvidenza operativa: Il sistema attualmente implementato è raggiungibile, progredisce, limita e produce il risultato esterno previsto? Il secondo strato è necessariamente specifico per l'applicazione. Un assistente di scrittura di progetti con revisione umana obbligatoria può tollerare incoerenze diverse da un agente di rimborso non sorvegliato. Il documento sottolinea lo stesso punto generale: i requisiti di affidabilità dovrebbero scalare con autonomia. Evitare di copiare un punteggio del leaderboard in una soglia di rilascio universale. Per gli effetti collaterali conseguenti, utilizzare il veto prima delle medie. Una ragionevole politica locale è: Questo ordine impedisce alle medie attraenti di nascondere stati sconosciuti o gravi. Aggiungere le prove di produzione che il documento non afferma di misurare Un benchmark valuta il comportamento in base a un protocollo definito. L'operatore deve anche sapere cosa sta succedendo. Aggiungi queste sei ricevute senza fingere che siano metriche extra di carta: E Freschezza delle prove: quando è stato verificato l'ultimo segnale di salute e quando scade. Reaccessibility: se il tempo di esecuzione e gli strumenti necessari possono essere contattati ora. Copertura di programma: che hanno iniziato, completato, sovrapposto o mancato le gare attese. Atteggiamento di proprietà: se una legittima dipendenza ha un proprietario, una scadenza e uno stato di ripresa. Conciliazione dell'effetto strumento: se un'azione temporanea o riprovata ha cambiato la destinazione zero, una o più volte. Verifica del risultato della destinazione: se il file promesso, la modifica della banca dati, il messaggio, il risultato del test o altri risultati di consegna esistono e soddisfano la sua regola di accettazione. Questo aggiunto previene due errori di categoria. In primo luogo, il successo ripetuto del benchmark non dimostra che attualmente sia raggiungibile un tempo di produzione. In secondo luogo, un comando o una risposta di modello di successo non dimostrano l'esistenza dell'effetto esterno o del consegnabile. La Repositorio di arnesi HAL collegata dal sito del progetto è utile qui perché enfatizza le valutazioni riproducibili, le tracce, l'isolamento e il monitoraggio dei costi. Questi sono forti input di valutazione. Hanno ancora bisogno di un oracolo di risultati specifico per la distribuzione e di ricevute operative correnti quando l'agente agisce al di fuori del benchmark. Usa la carta come profilo, non una scheda di permesso. Per una vera revisione, inizia con un solo flusso di lavoro piuttosto che con un'intera flotta: 1. Pin il tempo di esecuzione, il modello, il commit scaffold, le versioni degli strumenti, la versione del set di attività e la data di valutazione. 2. Eseguire ripetute sperimentazioni nominali e conservare risultati, traiettorie e registri delle risorse. 3. Prima di esaminare il risultato, definisci il difetto, l'ambiente e le perturbazioni immediate. 4. Prendi fiducia prima di classificarti. 5. Definire i limiti e i livelli di gravità; convalidare da parte dell'uomo un campione di sicurezza. 6. Tenere la sicurezza separata dall'aggregazione. 7. Leggi le sei classi di prove di salute viva. 8. Registrare unknown dove mancano prove. 9. Definire soglie e veto per l'autorità e le conseguenze di questo flusso di lavoro. 10. Rilanciare il profilo dopo modifiche del modello di materiale, del prompt, dello scaffold, dello strumento o dell'ambiente. In questo modo si conserva il contributo principale della carta: l'affidabilità è una forma, non un sinonimo di precisione. Inoltre impedisce che la forma diventi un cruscotto decorativo. Il risultato osservabile della revisione non è un punteggio di affidabilità è stato calcolato. Si tratta di una decisione versione con prove verificabili, sconosciuti espliciti e un chiaro elenco di ciò che deve essere verificato prima di espandere l'autorità. Il territorio previsto di Sidewisp è il lato operativo di tale confine: accessibilità, progressi utili, contesto, strumenti, risultati e costi intorno agli agenti che già operano altrove. Sidewisp è attualmente in anteprima privata. Gli adattatori di monitoraggio della produzione e i sistemi di recupero non sono generalmente spediti, quindi questo articolo descrive un metodo operativo, non una capacità automatizzata di Sidewisp corrente. Se il limite delle prove corrisponde ai fallimenti che devi catturare, puoi partecipare alla visualizzazione privata dal sito Sidewisp. Fonti Rabanser et al., verso una scienza della AI Agent Reliability, arXiv v3, giugno 2026 Metodologia di affidabilità dell'agente olistico Leaderboard Arnesto di valutazione riproducibile HAL Pagina di manifesto ICML 2026 Registro OpenReview