2026-08-01T15:00:28.695Z
AI Quadro di prova dell'agente: scegliere in base alle prove, non in base alle caratteristiche
Un selettore a quattro porte eseguibile confronta riproduzione, effetto strumento, memoria e prove di risultato, quindi espone gli adattatori ogni raccomandazione ancora necessaria.
Un quadro di prova degli agenti AIZ dovrebbe essere scelto in base alle prove che può riprodurre e verificare, non in base al numero di metriche nel suo catalogo. Per un agente dotato di uno stato, che utilizza strumenti, il primo prototipo ragionevole è quello di ispezionare AI quando gli ambienti usa e getta, l'esecuzione da parte di un agente esterno e i marcatori di codice sono centrali. LangWatch Scenario è il prototipo di forma migliore quando gli utenti simulati e il comportamento multi turn dominano. MLflow si adatta ai team i cui set di dati di valutazione e la storia degli esperimenti sono già lo strato organizzativo; DeepEval si adatta a un flusso di lavoro di regressione centrato su pytest. Questo è un ordine prototipo, non una classifica universale. Nessuno di questi framework sa se la tua fattura è stata creata una volta, la tua memoria è sopravvissuta a un riavvio, o il tuo consegnabile promesso è valido. Sono oracoli di applicazione. Un processo di selezione è onesto solo quando indica il lavoro rimanente prima dell'adozione. Iniziamo con le prove che il quadro deve lasciare alle spalle I test dell'agente non sono test immediati di ingrandimento. Un agente cambia di stato in più giri, attraversa i confini delle autorizzazioni, chiama gli strumenti, aspetta, riprova e può finire con un artefatto esterno. Una risposta finale fluida è un'osservazione tra diverse. Guida di valutazione degli agenti di Anthropic separa il compito, le prove, la trascrizione, il risultato, l'arneso di valutazione e i gradatori. Esso distingue anche la classificazione basata su codice, basata su modelli e umana. Questa decomposizione ci dà una utile domanda di selezione: Da dove provengono ogni fatto decisivo? Utilizzare quattro porte: Porta Richiesta di prove Sostituito falso comune Riproduci Lo stesso dispositivo può ripristinare le entrate pertinenti, lo stato dello strumento, le autorizzazioni e i dati di avvio Ri invio della stessa richiesta Effetto strumento La destinazione dimostra che l'effetto previsto è avvenuto con la giusta identità e conteggio Una traccia dice che lo strumento è stato chiamato Continuità di memoria Le decisioni richieste superano il confine che in realtà temete: riavviare, comprimere o consegnare La conversazione ha diversi turni. Verificazione dei risultati Un controllo deterministico dimostra che l'artefatto o lo stato promesso esiste e è valido L'agente dice che è finita. Un quadro può esporre i ganci per tutti e quattro senza implementare le tue quattro prove. Questo è accettabile. Il cattivo risultato è nascondere una query di database personalizzata, un dispositivo di riavvio o un validatore di artefatti sotto l'etichetta vaga integrazione. La distinzione è più importante a due confini. Una chiamata di strumento può terminare dopo che la destinazione ha commesso il suo cambiamento, quindi il successo del trasporto e il successo dell'effetto possono essere in disaccordo. Un test a più giri può preservare lo stato in un processo mentre l'agente impiegato perde la stessa decisione dopo un riavvio. Se un confronto quadro collassa una delle coppie, il suo punteggio non è utile per l'affidabilità dell'agente. Quattro quadri attuali, letture attraverso quei cancelli Ho esaminato la documentazione ufficiale corrente il 27 luglio 2026 e ho registrato solo superfici documentate. Un livello di custom inferiore non è una critica; significa che il quadro fornisce un punto di estensione mentre l'applicazione deve fornire la verità. Iinspect AI documenta set di dati composti, agenti, strumenti e punteggiatori, esecuzione da parte di agenti esterni, registri di valutazione e diversi backend di sandbox. Il suo panoramica ufficiale utilizza anche un agente che agisce attraverso strumenti all'interno di una scatola di sabbia Docker. Questo lo rende una solida superficie di partenza per compiti eseguibili e complessi. Un punteggiatore personalizzato può controllare l'ambiente risultante. Ha ancora bisogno di un connettore per la destinazione reale e di un oráculo di memoria di riavvio deliberatamente costruito. LangWatch Scenario inizia dalla simulazione a più giri piuttosto che da una riga di input output statica. Il suo documentazione di simulazione dell'agente mostra aspettative intermedi di chiamata degli strumenti, affermazioni personalizzate come un biglietto creato, test di recupero degli errori e riproduzione di problemi riscontrati nella produzione. Questa forma è attraente per il supporto, la voce e altri agenti interattivi. Lo stato di conversazione documentato non è la prova che una decisione sia sopravvissuta alla morte del processo, e un'affermazione del biglietto è ancora il codice di applicazione. MLflow organizza la valutazione attorno ai set di dati, alle funzioni di previsione, ai punteggiatori, ai risultati di esecuzione, ai feedback umani e al monitoraggio. La Presentazione generale della valutazione di GenAI attuale rende il punteggio personalizzato una parte di prima classe di una valutazione. Questo è utile quando il team tratta già i set di dati e la linea di origine degli esperimenti come fonte di verità. Il costo di selezione è l'arnesto di stato attorno alla funzione di previsione: ripristinare un mondo di strumenti, costringere un riavvio e conciliare gli effetti esterni. DeepEval offre esecuzioni di test locali, casi singoli e multipli, soglie, tracciamento e confronto di regressione in un flusso di lavoro a forma di pytest. Il suo Inizio rapido è un facile accesso per i team che vogliono valutazioni oltre ai test applicativi. Il faststart si basa su metriche basate su modelli, quindi una prova operativa di adattamento dovrebbe aggiungere controlli deterministici di effetto e di risultato piuttosto che supporre che un punteggio di giudice dimostri lo stato di destinazione. Quadro Centro di gravità documentato Prototipo prima quando Adattatori espliciti per la prova Ispezione AI Tasche eseguibili dell'agente, strumenti, scatole di sabbia, punteggiatori L'agente modifica i file o altri stati ispezionabili Effetto di destinazione reale; riavvio della memoria Scenario di LangWatch Simulazioni a più giri e affermazioni a passo Comportamento dell'utente e percorsi di recupero guidano i guasti Effetto di destinazione reale; riavvio della memoria Flusso ML Dataset, punteggi, cronologia di esecuzione, feedback Ciclo di vita e le linee di valutazione sono già presenti in MLflow Fissura di stato; effetto; memoria di riavvio Profunzione Regressione e tracciamento di metriche in stile pitest Il team ha bisogno di un punto di ingresso leggero. Fissura di stato; effetto; memoria di riavvio; risultato deterministico Questa tabella è deliberatamente più ristretta di una comparazione dei prodotti. Non dice nulla sul prezzo dell'hosting, sul supporto, sulla reattività dei gestori o su ogni integrazione. Risponde a una domanda: quale superficie di esecuzione documentata e' piu' vicina alle prove necessarie per questo agente? Fai passare il selettore, poi non ti fidi del punteggio. La framework evidence.json che accompagna la registrazione di quattro livelli di prova per ciascun candidato. 0 significa che non sono conservate prove di fonte primaria, 1 significa che è richiesto un adattatore o un punteggiatore personalizzato esplicito e 2 significa che la documentazione presenta un flusso di lavoro di prima classe. Lo scenario dello stato dello strumento misura il riproduzione a 2 , gli effetti degli strumenti a 4 , la continuità della memoria a 4 e i risultati verificati a 5 . Eseguire l' artefatto: La parte decisiva della produzione è: L'inspezione e lo scenario di LangWatch ricevono entrambi un punteggio ponderato di prova di 22 . L'inspezione vince questo sistema solo perché il carico di lavoro dichiarato è stateful tool , che aggiunge un bonus di adattamento di tre punti. Cambiare il carico di lavoro a simulazione a più giri e l'ordine dovrebbe cambiare. Cambiare i pesi e il risultato potrebbe cambiare. Questa sensibilità è una caratteristica: rende le ipotesi del team rilevabili. Il punteggio non deve mai cancellare le lacune. Un risultato che affermi che l'adattatore non funziona qui sarebbe meno credibile, non più. La matrice non può conoscere lo schema della destinazione, la regola di identità per un effetto, le decisioni che la memoria deve mantenere, o la regola di validità per il consegnabile. L'artefatto ha anche una dura limitazione: si tratta di un'audit della documentazione datata. Non installa tutti e quattro i quadri né misura il tempo di integrazione. Usalo per scegliere l'ordine degli esperimenti, poi lasciate decidere due casi scomodi. Far fallire la prova di adesione in due modi diversi Il primo caso mette alla prova un effetto ambiguo degli strumenti. Organizzare un dispositivo di destinazione in cui lo strumento impegni un oggetto e il trasporto restituisce un timeout. L' arneso passa solo se può: 1. mantenere un'identità di funzionamento stabile oltre il confine di riprova; 2. ispezionare la destinazione piuttosto che fidarsi del risultato della chiamata; 3. classificare lo Stato come impegnato, non riprovarlo ciecamente; 4. mostrare le prove in un record di esecuzione che un sviluppatore può debug. Il secondo caso di prova riavvia la continuità. Lasciate che l'agente scelga un piano limitato, persista solo lo stato di decisione consentito, interrompa il suo processo e riprenda con un nuovo processo. L' arneso passa solo se può: 1. dimostrare che si è verificato il riavvio; 2. ripristinare lo stesso apparecchio senza perdite dello stato di risposta nascosta; 3. verificare che la decisione richiesta sia sopravvissuta; 4. rilevare memoria obsoleta, mancante o contraddittoria; 5. verificano l'artefatto finale in modo indipendente. Se l'agente richiede l'approvazione, includere una legittima attesa come controllo. Un arneso di prova che segna ogni pausa come fallimento pressione il prodotto per rimuovere i confini di sicurezza autoritaria. La prova dovrebbe distinguere tra lavorare, aspettare, rimanere bloccati e completare piuttosto che premiare l'attività ininterrotta. La scatola temporale e' il prototipo. Un piccolo team non dovrebbe costruire uno strato di adattatore generale prima di aver riprodotto questi due fallimenti. Date a ciascun candidato lo stesso dispositivo, lo stesso oracolo di risultato e lo stesso budget di debugging. Preferire il quadro che renda la catena di prove più breve e più verificabile, anche se un altro candidato produce metriche più aggregate. Il risultato non è framework X è il migliore. È framework X raggiunge le nostre due prove dure con questi adattatori chiamati, e framework Y non è all'interno dello stesso budget. Questa affermazione può sopravvivere a una revisione del codice. Le prove di prova non sono sanità degli agenti viventi. La valutazione pre uscita risponde se una build può gestire attività conosciute e fallimenti controllati. La salute in diretta chiede se un determinato agente è raggiungibile ora, facendo progressi utili, mantenendo il contesto richiesto, raggiungendo i suoi strumenti, producendo il risultato atteso e rimanendo entro limiti di tempo e costi ragionevoli. Passare una valutazione non dimostra che un programmatore sia stato licenziato ieri sera, che una credenziale sia valida oggi, o che un prodotto consegnato abbia raggiunto la sua destinazione reale. Il territorio previsto di Sidewisp è quello dello strato di salute intorno ai tempi di esecuzione esistenti: distinguere il lavoro dall'attesa o dalla bloccata, mostrare la prova e la freschezza e verificare i risultati prima di risolvere un problema. Sidewisp è attualmente in anteprima privata. L'esperienza pubblica è un sito web di accesso precoce e una dimostrazione interattiva; generalmente non vengono inviati i raccolti di agenti di produzione, gli adattatori runtime e il recupero automatico. Quindi tenete chiari i confini. Utilizzare il quadro di prova scelto per rendere visibili le regressioni controllate prima del rilascio. Utilizzare prove specifiche per il tempo di esecuzione e controlli indipendenti dei risultati per stabilire la salute del vivo dopo il rilascio. Un test verde è una prova preziosa, ma non è il permesso di trattare un agente non osservato come sano.