2026-08-01T02:45:30.248Z

Agent Memory Benchmark: Audit delle lacune dietro un punteggio

Mappa AMB, MemoryArena, e STATE-Bench alle prove che producono effettivamente, quindi aggiungere riavvio, freschezza, conflitto, e destinazione controlli.

Un benchmark di memoria agent è utile solo quando il suo test corrisponde al fallimento che è necessario catturare. L'accuratezza del recupero può dimostrare che il materiale immagazzinato è rilevabile. Non può, da solo, dimostrare che la memoria sia sopravvissuta a un riavvio, che la versione più recente abbia vinto un conflitto o che un agente abbia usato la memoria per produrre il risultato esterno previsto. Il default pratico non è quindi scegliere il punteggio più alto. Scegliere il punto di riferimento il cui metodo esercita la decisione più rischiosa, mantenere visibili le sue domande scoperte e eseguire un piccolo canario di produzione accanto a esso. Ho controllato tre approcci attuali: AMB, MemoryArena e STATE Bench, contro sette domande. Nessuno documenta l'intero set operativo. Tre parametri di riferimento, tre diverse unità di prova A.M.B. documenta una pipeline di quattro fasi: ingerire documenti, recuperare il contesto, generare una risposta, quindi utilizzare un secondo modello per giudicare la risposta rispetto alle risposte di oro. Ritracca il tempo di recupero e ingestione, nonché l'accuratezza, la velocità e il costo del token. Questo rende AMB utile quando la decisione riguarda la qualità del recupero e l'economia tra i fornitori di memoria. Il suo metodo spiega anche perché agentic in un nome di set di dati non è sufficiente. L'evento terminale documentato è ancora una risposta generata e un risultato giudiziario. Questa è una prova significativa del risultato, ma non è la stessa cosa di osservare un agente cambiare correttamente un sistema di destinazione. MemoriaArena sposta l'unità di prova in un ciclo di memoria agente ambiente. I suoi 766 compiti creati dall'uomo hanno sottoattività interdipendenti tra le sessioni. Le azioni successive dipendono dalle informazioni e dai feedback acquisiti in precedenza, attraverso la navigazione web, la pianificazione limitata, la ricerca progressiva e il ragionamento sequenziale. Il documento riporta una media di 57 passi di azione per compito. Tale progettazione affronta una vera e propria debolezza nella valutazione solo per richiamo: un agente può recuperare un dato di fatto ma non lo applica quando l'ambiente cambia. MemoryArena rende la memoria una conseguenza per l'azione successiva. Tuttavia, un compito multi sessione non è automaticamente un test di riavvio del processo. A meno che l'arneso non distrugga deliberatamente il componente di memoria e non dimostri uno stato duraturo dopo l'avvio, la persistenza rimane una questione separata. Tribunale di Stato testano 450 compiti aziendali di stato attraverso viaggi, assistenza clienti e shopping. La sua traccia di apprendimento degli agenti può fornire ricordi riutilizzabili attraverso un gancio di recupero. Le metriche principali sono pass@1, pass^5 attraverso cinque run, un punteggio di esperienza utente giudicato da LLM e costo per attività. Il limite di punteggio conta. Microsoft descrizione della liberazione dice che le attività di mutazione dello stato utilizzano affermazioni deterministe contro lo stato finale dell'ambiente, mentre le attività procedurali e informative utilizzano un giudice LLM. I risultati dei controlli STATE Bench sono accurati; non tutti i risultati STATE Bench sono deterministici. Mantenere gli stati di copertura invece di produrre un punteggio Ho mappato ogni metodo documentato in sette domande. Covered significa che il metodo esercita direttamente la domanda. Partial significa che fornisce prove pertinenti, ma non presenta l'intera affermazione operativa. Not documented significa esattamente questo; non si tratta di un'accusa che un progetto non possa eseguire un tale test. Domanda di prova A.M.B. MemoriaArena Tribunale di Stato Qualità di recupero Coperto Parzialmente Parzialmente Guidi di memoria per l'azione successiva Parzialmente Coperto Coperto Esito finale deterministico Parzialmente Parzialmente Parzialmente Persistenza di riavvio deliberato Non documentato Parzialmente Non documentato Freschezza e provenienza Non documentato Non documentato Non documentato Affidabilità di gestione ripetuta Non documentato Non documentato Coperto Costo o efficienza Coperto Non documentato Coperto Questa tabella non deve essere ridotta a due su sette o cinque su sette. La copertura non è additiva. Se l'incidente che temete è una politica di rimborso obsoleta sopravvissuta ad un aggiornamento, l'accuratezza di recupero su un corpus statico e cinque esecuzioni di attività stabili possono essere entrambi verdi mentre il pericolosa conflitto rimane intatto. L'artefatto di audit convalida la matrice e elenca ogni domanda operativa non rivelata senza calcolare un punteggio composto: Applicando tale regola alla matrice supportata dalla fonte prodotta: Questo risultato è falsificabile. Un punto di riferimento può modificare il suo metodo, aggiungere una regolazione esplicita di riavvio, richiedere la provenienza con versioni o sostituire un giudice con affermazioni deterministiche di destinazione. Aggiorna la matrice quando il metodo pubblico cambia. Non conservare una vecchia etichetta non documentata come folklore. Scegli per il fallimento, non per il leaderboard Inizia con la decisione concreta che farai dopo la corsa. Se si sceglie un fornitore di recupero, i dati di ingestione/ripresa/generazione/giudicazione e di timing di AMB sono direttamente utili. Eseguire lo stesso set di dati, dominio, modello di generazione, giudice prompt e modalità per ogni provider. Il suo README avverte che piccole modifiche del prompt o del modello possono spostare l'accuratezza di due cifre, quindi un confronto senza tali pin di versione non è riproducibile. Se il rischio è che le informazioni ricordate siano disponibili ma non cambiano il comportamento successivo, utilizzare un test associato all'azione. Le sottoattività interdipendenti di MemoryArena rendono le informazioni precedenti causalmente necessarie nelle sessioni successive. Conserva il manifesto delle attività e la versione dell'ambiente, poi controlla la prima azione che diverge non solo dal punteggio finale della attività. Se la decisione è se la memoria migliora costantemente un flusso di lavoro di stato, STATE Bench offre un default più forte. Confrontare la linea di base senza memoria con lo stesso agente più memoria; mantenere pass@1, pass^5, costo e il tipo di punteggio separati. Un guadagno di completamento medio con un calo del pass^5 non è una promozione pulita. Inoltre, un passaggio procedurale giudicato da LLM non equivale ad un'affermazione di base di dati deterministica. Queste opzioni possono essere combinate. Un piccolo team potrebbe eseguire AMB per eliminare un'implementazione di recupero troppo imprecisa o costosa, quindi eseguire una suite di azioni accoppiate focalizzate, quindi utilizzare un sottogruppo STATE Bench per risultati ripetuti del flusso di lavoro. La sequenza è difensibile perché ogni fase risponde a una domanda denominata. Un numero di classifica combinato nascondeva il motivo per cui un candidato ha superato. La limitazione è importante: questo audit confronta i metodi documentati; non ripete ogni punto di riferimento o afferma che non esistono test privati senza documenti. Le attività sintetiche, gli utenti simulati, i modelli di valutazione, la copertura del dominio e le revisioni del repository limitano l'entità del trasferimento di un risultato al carico di lavoro. Aggiungere i controlli operativi Le prove offline dovrebbero finire al limite della promozione. Un canario vivente compatto dovrebbe iniziare da lì. Utilizzare identificatori privi di contenuti quando la memoria reale può contenere materiale privato. Ad esempio, scrivete un ID casuale, una versione, un hash di una decisione attesa e un tempo di scadenza. Mantenete i dati grezzi, le conversazioni, i segreti e i dati dei clienti fuori dall'evento sanitario. Allora esegui questa catena: 1. Aconoscere la write. Registrare lo spazio di nome della memoria, ID canario, versione attesa, versione adattatore e ricevuta di scrittura. Una risposta HTTP di successo non è la prova che l'indice richiesto o lo store durevole abbia accettato il record. 2. Cross un vero confine di riavvio. R riavviare il servizio di memoria, il tempo di esecuzione dell'agente o l'adattatore host di cui dipende effettivamente. Iniziare una nuova conversazione all'interno dello stesso processo mette alla prova un confine diverso. 3. Leggi con freschezza e provenienza. Richiedi la versione attesa e un riferimento alla fonte verificabile. Un valore più vecchio semanticamente plausibile è un fallimento, non un quasi mancato. 4. Inserire un conflitto. Scrivere un valore più recente, mantenere l'identificatore vecchio, e verificare che il risolutore restituisca il vincitore previsto. Registrare se la politica è stata scritta per l'ultima volta, una versione esplicita, la priorità della fonte o l'approvazione umana. 5. Require un'azione conseguente. Date all'agente un compito in cui l'argomento di strumento corretto dipende dal canario. Verificare l'argomento o la transizione dello stato, non l'esposizione che il modello produce. 6. Verifica la destinazione. Leggi il sistema esterno o l'artefatto che rappresenta il completamento. L'uscita dal comando, il successo delle chiamate degli strumenti e il successo segnalato dagli agenti sono prove di attività. 7. Repeat all'interno dei limiti. Eseguire casi equivalenti sufficienti per rivelare l'incoerenza, mentre si fissano le versioni di modello, prompt, strumento e ambiente. Costi di tracciamento accanto al risultato verificato. Una ricevuta minima può sembrare così: Non segnalare il percorso di memoria sano se un campo richiesto non è disponibile. Ritorna uncertain , conserva l'ultimo tempo di prova conosciuto, e indirizza il segnale mancante a una persona. La risposta sicura a prove incomplete non è un nuovo tentativo automatico che possa ripetere un effetto esterno. Una regola di promozione che puoi spiegare Promuovere un cambiamento di memoria solo quando tre affermazioni sono tutte vere: l'indice di riferimento scelto esercita direttamente il comportamento che ha motivato il cambiamento; i risultati ripetuti migliorano o mantengono la qualità senza violare il limite di costo concordato; il canario vivo dimostra la persistenza di riavvio, la corretta versione/ provenienza, l'uso conseguente e l'esito previsto della destinazione. Se una affermazione non è corroborata, mantenere il cambiamento nella valutazione. Questa regola è deliberatamente più rigorosa di quanto non sia stato il benchmark in aumento, ma più ristretta di quanto non sia stata la creazione di una piattaforma di valutazione universale. Questo dà a una piccola squadra un motivo verificabile per procedere o fermarsi. La direzione del prodotto Sidewisp tratta le letture o le scritture mancanti di memoria, la persistenza fallita durante i riavviamenti, la sincronizzazione obsoleta, i ripristinamenti, la crescita del contesto e le decisioni perse come segnali di salute. Il motore di monitoraggio della produzione e gli adattatori di tempo di esecuzione non sono inviati nel sito web corrente. Sidewisp è attualmente in anteprima privata. Se il modello di prova corrisponde al modo in cui si gestiscono gli agenti, è possibile unirsi alla lista di attesa di anteprima privata senza sostituire il tempo di esecuzione o trattare un benchmark offline come un certificato di salute in diretta.