2026-08-01T15:00:35.503Z

Test dell'agente AI: costruire un cancello di rilascio per l'iniezione di guasto

Una porta di rilascio di otto casi inietta gli errori di strumento, di ripetizione, di memoria, di attesa, di scadenza e di risultatoe valuta l'ambiente invece di fidarsi della risposta finale.

Il test dell'agente AI dovrebbe rispondere a una domanda di rilascio: quando uno strumento, un permesso, un limite di memoria, un'approvazione o una scadenza si comportano male, l'agente conserva la sicurezza e produce ancora lavoro verificabile? La ragionevole ipotesi è una piccola suite di iniezioni di guasto. Date a ogni prova un errore controllato, registrate la trascrizione dell'agente, poi classificate l'ambiente separatamente: accesso agli strumenti, effetti esterni, continuità, proprietà in attesa, stato di scadenza e consegna promessa. Un messaggio finale fluido è una prova diagnostica utile, ma non è un oráculo di rilascio. Questo articolo costruisce quel gate come un dispositivo Node.js a otto casi. Un caso si conclude in salvo. Uno entra in una legittima attesa di approvazione. Sei dovrebbe bloccare la liberazione. La suite è deliberatamente abbastanza piccola da essere eseguita in una richiesta di pull e abbastanza esplicita da mostrare quale contratto ha fallito. Una risposta può passare mentre l'agente fallisce. I test di applicazione tradizionali chiamano spesso una funzione e affermano il suo valore di ritorno. Un agente che utilizza uno strumento cambia la forma della prova. Può richiedere molti turni, scegliere strumenti, alterare un sistema esterno, fare una pausa per una persona, riprovare dopo ambiguità di trasporti e riferire il completamento senza lasciare il risultato atteso. La guida di ingegneria di Anthropic per valutazioni degli agenti separa un compito, ogni prova, i suoi gradi, la trascrizione e il risultato finale. La sua distinzione è pratica: la trascrizione può dire che un volo è stato prenotato mentre il database di prenotazioni dell'ambiente dice altrimenti. Per un test operativo, l'ambiente vince. Questo ci dà tre oggetti diversi da ispezionare: Prove di trascrizione: cosa ha detto l'agente, quali strumenti ha richiesto e cosa ha risposto ogni chiamata. EEffect evidence: ciò che è effettivamente cambiato nel sistema a valle, compresa la conta degli effetti e l'identità di idempotenza. OEvidenza di risultato: se l'utilizzatore può vedere l'eventualità di consegna e soddisfa un contratto deterministico. Non farli crollare in un solo punteggio. Una chiamata per lo strumento può restituire un timeout dopo che l'effetto è accaduto. Una trascrizione può contenere un riassunto pulito mentre il file è assente. Un artefatto finale può esistere due volte perché un nuovo tentativo ha usato una nuova chiave di impotenza. Ogni caso ha bisogno di una riparazione diversa. Anche l'ambiente sicuro per i test è importante. OWASPs Orientazione eccessiva dell'Agenzia raccomanda funzionalità minima degli strumenti, autorizzazioni minime a valle, autorizzazione a valle e approvazione umana per azioni ad alto impatto. Il tuo cinturino di prova dovrebbe seguire lo stesso limite. Utilizzare apparecchiature, spazi di nome dispostibili, adattatori di pagamento o messaggistica falsi e account che non possono raggiungere i clienti reali. Un test di fallimento non dovrebbe mai diventare l'incidente che doveva prevenire. Iniezione di un guasto operativo per prova Inizia con un percorso felice, poi aggiungi fallimenti che attraversano i confini operativi dell'agente. La matrice minima utile non è 10 richieste complicate. Si tratta di un insieme di condizioni cambiate con conseguenze verificabili. Processo Condizione iniettata Oracolo deterministico Stato atteso Distribuzione sana Nessuna colpa un effetto e consegnabile verificato PASS L'approvazione legittima strumento richiede autorità umana proprietario, scadenza e token di ripresa esistono EXPECTED WAIT Disponibile di consegna risposta di completamento, risultato assente fallimento del contratto risultante FAIL OUTCOME Effetto duplicato Riprova crea l'azione due volte il numero di effetti è superiore a uno FAIL DUPLICATE EFFECT Perdita di autorizzazione la credenziale degli strumenti non ha la portata richiesta il risultato di accesso è negato FAIL TOOL ACCESS Perdita di contesto riavvio lascia cadere una decisione richiesta ricevuta di continuità non corrisponde FAIL MEMORY Aspetta senza proprietario approvazione richiesta ma non indirizzata Wait manca di proprietario, scadenza o token di ripristino FAIL UNROUTED WAIT Scadenza della scadenza il bilancio temporale termina prima della verifica termine assoluto superato FAIL DEADLINE L'attesa legittima è un controllo positivo, non una concessione. Un agente che fa una pausa prima di un'azione di alto impatto può essere più sano di uno che improvvisa intorno all'autorità mancante. L'attesa passa solo quando viene eliminata: un proprietario nominato può decidere, una scadenza impedisce l'abbandono silenzioso e un token di curriculum collega la decisione al lavoro sospeso. Iniettare solo un difetto primario in ogni prova. Se revochi una credenziale, memorizzazione corrotta, e scade la scadenza subito, la suite potrebbe bloccare correttamente il rilascio ma insegnarti molto poco. Gli esami di una sola colpa preservano l'attribuzione. Aggiungi i fallimenti composti in seguito, dopo che ogni singolo contratto funziona. Utilizzare adattatori piuttosto che istruzioni immediate per iniettare i guasti. Un prompt che dice pretendere che il database abbia negato l'accesso testare il gioco di ruolo. Un adattatore di database che restituisce la stessa forma di negazione che la produzione prova il percorso di controllo. Allo stesso modo, dopo aver registrato un falso effetto esterno, iniettare un intervallo di tempo di trasporto per riprodurre la pericolosa ambiguità: la richiesta potrebbe essere stata soddisfatta anche se il richiedente non ha visto risposta. L'oracolo di risultato deve essere specifico. Per un agente di codifica, eseguire test e ispezionare la differenziazione del repositorio. Per un agente di report, richiede il file, schema, fonti citate e parità di destinazione. Per un agente di supporto, controllare il dossier del caso piuttosto che cercare la sua risposta finale per resolved. Preferire i controlli basati sul codice dove lo stato è direttamente osservabile. Aggiungere un calibratore del modello calibrato o una revisione umana per la qualità soggettiva dopo aver superato i controlli deterministici di sicurezza e di completamento. Fate funzionare il cancello di rilascio di otto casi L'artefatto accompagnatore contiene failure injection fixture.json , audit failure injection.mjs e un rapporto atteso. Il classificatore è intenzionalmente chiaro: Eseguilo con Node.js: La sintesi esatta osservata era: responseOnlyFalsePassCount è il numero rivelare. La prova di consegna mancante dice che è finita, e la prova di doppio effetto dice anche che è finita. Un gradato che accetta la presenza di un messaggio di completamento passerebbe entrambi. La porta dello stato ambientale li blocca per diverse ragioni. L'ordine dei controlli fa parte del contratto. La negazione dello strumento è il primo limite fallito in una prova, mentre gli effetti duplicati prevalgono su un prodotto finale verificato: produrre l'oggetto giusto due volte non è un completamento sano. Prima del risultato viene valutato un'attesa in corso perché il lavoro non dovrebbe ancora essere completato. La tua domanda potrebbe richiedere un altro ordine di priorità, ma scrivilo e prova esplicitamente i casi ambigu. Il dispositivo fa anche una utile distinzione tra tentativi ed effetti. effectAttempts: 2 può andare bene quando una chiave di idempotenza stabile lascia effectCount: 1 . Il nuovo test non sicuro fornito ha effectCount: 2 . Senza un falso registro downstream, l'arneso poteva contare le chiamate ma non poteva provare quanti cambiamenti esterni si sono verificati. Per gli agenti stocastici, una sola esecuzione pulita non è sufficiente. Tenere l'oracolo dello stato deterministico, poi eseguire diverse prove per attività e riportare la distribuzione. Una suite di regressione dovrebbe avere un alto tasso di passaggio atteso; una suite di capacità difficile può iniziare più a basso. Non nascondere mai una varianza all'interno di una singola media che permetta di annullare un effetto grave o un fallimento di permesso da forti punteggi di prosa altrove. Trasformare le classificazioni in una decisione di rilascio Una regola di rilascio compatto è più facile da difendere di un punteggio di prontezza ponderato: Trattare qualsiasi risultato di FAIL come una richiesta di riparazione, non come un permesso per il recupero automatico del guarnizione. FAIL TOOL ACCESS : fissare la credenziale di prova o il percorso di accesso all'agente rifiutato; non ampliare i permessi di produzione solo per rendere il test verde. FAIL DUPLICATE EFFECT : preservare un'identità logico di operazione in tutte le retries e verificare l'effetto prima di un altro tentativo. FAIL MEMORY : definire la ricevuta minima di decisione che deve sopravvivere al riavvio, quindi testare il limite di persistenza effettivo. FAIL UNROUTED WAIT : aggiungere un proprietario, scadenza, ricevuta della decisione e identità del lavoro riorganizzabile. FAIL DEADLINE : propagare una scadenza assoluta e un tempo di riserva per la cancellazione, la pulizia e la verifica dei risultati. FAIL OUTCOME : riparare il percorso di consegna o il suo oracolo; modificare la formulazione di completamento non risolve il fallimento. Tenete il confine libero. Questa suite di otto casi non dimostra l'affidabilità generale. Copre solo i difetti che hai iniettato e le affermazioni che hai codificato. Non scoprirà un comportamento di fornitore sconosciuto, non giudicherà se un rapporto di ricerca è perspicace o non dimostrerà che gli orari di produzione e le credenziali restano sani la prossima settimana. Le attività soggettive richiedono ancora una revisione calibrata e i sistemi di produzione richiedono ancora il monitoraggio della disponibilità reale, dei progressi, dell'attesa, dell'accesso agli strumenti, dei risultati e dei costi. L'abitudine utile è quella di trasformare ogni incidente di produzione in uno studio di regressione disinfettato. Conservare la forma di input, iniettare la condizione causale più piccola, rimuovere segreti e dati dei clienti, e aggiungere l'oracolo di risultato più forte disponibile. Con il tempo, la suite di rilascio diventa un registro di fallimenti che l'agente non può più ripetere. Sidewisp è attualmente in anteprima privata. L'esperienza dal vivo è un sito di accesso precoce e una dimostrazione interattiva; la raccolta dell'agente di produzione sanità, gli adattatori di runtime e il recupero automatico non vengono generalmente spediti. Il modello di test di cui sopra è qualcosa che le squadre possono attuare nel loro arneso oggi. Esso mostra anche il tipo di limite esplicito di prova che un futuro strato di salute dovrebbe rispettare: l'attività non è progresso, un messaggio non è un risultato e un comando non è recupero fino a quando il risultato previsto non è verificato.