2026-08-01T08:39:12.441Z
ReasoningBank: Audit della memoria che si sviluppa prima della promozione
Trasforma ReasoningBank in una porta di memoria pronta per l'operatore con provenienza, persistenza, verifica indipendente, test di regressione ombra e rollback.
La risposta utile a ReasoningBank: Scaling Agent Self Evolving with Reasoning Memory non è Lasciare che l'agente riscriva la sua memoria dopo ogni corsa. Il documento presenta un modo promettente per distillare strategie dalle traiettorie di successo e fallite. Un operatore ha ancora bisogno di una regola separata per decidere quando una di queste strategie può influire sul lavoro in diretta. Utilizzare la quarantena come default. Tenere un nuovo oggetto di memoria fuori dal recupero attivo fino a quando non riesci a rintracciare da dove è venuto, provare che è stato memorizzato correttamente, verificare il risultato sorgente indipendentemente ove possibile, eseguirlo contro una suite di ombre fissa, e tornare alla banca precedente se il comportamento regressa. La promozione dovrebbe essere una decisione esplicita, non un effetto collaterale dell'estrazione. Questo limite conserva l'idea centrale del documento, affrontando un'altra questione: non se la memoria di ragionamento possa migliorare le prestazioni di riferimento, ma se un particolare aggiornamento di memoria è abbastanza sano da influenzare il prossimo compito reale. Cosa contribuisce ReasoningBanke cosa verifica Il documento della ReasoningBank sostituisce il riutilizzo della traiettoria grezza con le memorie strategiche compatte. Ogni elemento ha un titolo, una descrizione di una frase e un contenuto contenente passi di ragionamento, ragioni di decisione o lezioni operative. Il ciclo ha tre parti: 1. recuperare elementi pertinenti per un nuovo compito; 2. valutare la traiettoria completata, quindi trarre lezioni dal successo o dal fallimento; 3. consolidare tali voci nella banca. Il percorso del fallimento conta. Una traiettoria del browser fallita può produrre una lezione preventiva come verificare un identificatore di pagina prima di ripetere un'azione di paginazione. Questo è più riutilizzabile che memorizzare una lunga sequenza di clic. Il Spiegazione di Google Research descrive lo stesso ciclo di recupero, estrazione e consolidamento e segnala miglioramenti rispetto alle linee di base di memoria libere e precedenti su WebArena e SWE Bench Verified. Tali risultati costituiscono una prova del metodo all'interno dell'impianto valutato, non una garanzia di produzione. La carta utilizza un LLM as a judge per etichettare le traiettorie senza feedback sulla verità di fondo. Gli oggetti appena estratti vengono allegati direttamente, senza potatura. Il recupero si basa sull'incorporazione di similitudini. Gli autori mantengono deliberatamente questi pezzi semplici in modo da poter isolare il valore del contenuto orientato al ragionamento. Il progetto archivio di riferimento rafforza il confine: rilascia il codice WebArena e SWE Bench, mentre il suo README afferma che il progetto è per dimostrazione e non è destinato alla produzione. Questo è un utile avvertimento, non un difetto. Un'implementazione della ricerca e un controllo operativo risolvono diversi problemi. Contenuto di memoria separato dall'autorità di promozione ReasoningBanks schema {title, description, content} è leggibile dall'uomo e facile da iniettare in un prompt. Non richiede un identificatore di traiettoria sorgente, hash di estrazione, tipo di verificatore, versione, scadenza, set di conflitti, risultato ombra, approvatore o puntatore di rolloback. Questo è appropriato per l'esperimento. È insufficiente in quanto unico record di un cambiamento che colpisce la produzione. Involgere ogni elemento estratto in una busta di operatore: Questa busta non rende la memoria vera. Rende la decisione verificabile. Esso separa anche cinque eventi che sono facili da trasformare in uno: l'estrazione completata, una scrittura riuscita, l'oggetto sopravvissuto a una rilettura, il consiglio aiutato su casi ombrosi, e una persona autorizzata ha permesso al recupero attivo. La distinzione è importante perché l'attività non è progresso. Una banca di memoria può crescere dopo ogni compito mentre la qualità del recupero diminuisce. Nella propria ablazione del documento, l'utilizzo di un'esperienza pertinente batte l'utilizzo di gruppi più grandi; il successo è sceso quando sono state recuperate esperienze 2, 3 e 4 in quella situazione valutata. Il risultato non definisce un top k universale, ma contraddice un'ipotesi operativa tentacolare: un materiale più ricordato non è automaticamente più sano. Chiedi cinque prove prima della promozione. Le cinque prove di seguito sono deliberatamente indipendenti. Un passaggio in una colonna non compensa un fallimento in un'altra. 1. provenienza Registrare la traiettoria della fonte, il suo risultato osservato, il prompt o la versione di estrazione e un hash dell'elemento indotto. Una memoria senza provenienza dovrebbe rimanere in quarantena anche se i suoi consigli sembrano ragionevoli. Altrimenti l'operatore non può distinguere un'estrazione corrente da un'importazione obsoleta, da un'articolo duplicato o da una modifica manuale. 2. Persistenza duratura Non equiparare una chiamata scritta di successo con la memoria conservata. Rileggere l'elemento memorizzato attraverso lo stesso limite che il runtime utilizzerà, confrontare il suo hash e ripetere il controllo dopo il ripartito o l'indice di aggiornamento pertinente. Un elemento mancante o modificato è un errore di persistenza; un percorso di lettura non disponibile è unknown , non sano. 3. Evidenza indipendente sul risultato Il documento riporta la robustezza per giudicare il rumore, ma elenca anche la dipendenza da LLM as a judge come limitazione. Per una promozione operativa, preferire un verificatore deterministico: hash di file atteso, test di passaggio, stato API, conteggio di righe o altra ricevuta specifica di attività. Utilizzare la revisione umana quando il risultato non può essere verificato meccanicamente. Un verdetto LLM può dare priorità alla revisione, ma non dovrebbe essere l'unica autorità per una memoria che cambia il comportamento futuro. 4. Regressione delle ombre e copertura della deriva Confronta il candidato con una suite di versioni senza lasciare che influisca sulle attività in diretta. Includere i casi in cui la strategia dovrebbe aiutare, i casi in cui dovrebbe essere irrilevante e almeno un caso limite in cui l'eccessiva applicazione sarebbe dannosa. Confronta i risultati, non con fluenza. Segui la versione bancaria, il modello, gli strumenti e la versione fissiva in modo che una successiva modifica non si mascherino come deriva di memoria. La soglia appartiene al rischio del compito. La cornice di accompagnamento utilizza quattro casi e un tasso di passaggio dell'80% solo per rendere riproducibile la regola decisionale; tali numeri non costituiscono una raccomandazione generale. Uno strumento distruttivo può richiedere che ogni caso critico passi. Un assistente di scrittura reversibile può tollerare un confine diverso. 5. Accettazione esplicita e preparazione al ritorno Passare i controlli tecnici significa essere "preparato per l'approvazione" e non "promosso automaticamente". Dopo la promozione, eseguire di nuovo un piccolo set di canarie e guardare i risultati verificati del compito. Se appare una regressione critica, ripristina prima la versione precedente; indaghi in secondo luogo. Riproduce la regola decisionale in sei casi inconvenienti Ho codificato il gate come un piccolo classificatore Node.js e l'ho eseguito contro sei candidati. La regola controlla la provenienza, un ricevimento di persistenza di scrittura plus reread, prove deterministiche o umane di risultati, copertura ombra, conflitti di memoria attiva e un puntatore di ritorno. Si applica quindi questa priorità: L'ordine è intenzionale. Una regressione attiva richiede un rallentamento anche se la promozione iniziale è stata approvata. Le prove mancanti non possono essere riparate con l'approvazione. Un conflitto non è automaticamente un fallimento perché due strategie possono avere scoppi diversi, ma ha bisogno di una persona o di una regola deterministica più forte prima dell'attivazione. Eseguire il dispositivo con: La produzione fissa era: Candidato Condizione della prova Decisione mem 001 Nessuna provenienza; verdetto solo dal giudice quarantine mem 002 provenienza presente; il giudice rimane l'unica prova risultante quarantine mem 003 tutte le prove passano; conflitti con un elemento attivo review conflict mem 004 passaggio delle prove tecniche; nessuna approvazione dell'operatore ready for approval mem 005 tutte le prove passano e l'approvazione è registrata promote mem 006 L'elemento attivo non è più al limite dell'ombra. rollback Questo dispositivo aggiunge informazioni che il documento non cerca di fornire: un confine di autorità concreto attorno a una singola memoria indotta. Znot riproduce i benchmark della carta, convalida ogni strategia estratta o dimostra che un punteggio ombrale dell'80% si generalizzerà. Il cambio di distribuzione può ancora sconfiggere la suite. I conflitti possono essere sottili. L'approvazione umana può ancora essere sbagliata. Operare il circuito senza fingere che sia risolto Una implementazione pratica di ReasoningBank dovrebbe quindi avere due banche, non un unico pool indifferenziato: una banca di quarantena che accetta nuovi oggetti estratti e conserva le loro prove; una banca attiva che contiene solo versioni di articoli approvati utilizzati per il recupero in diretta. Misurare la transizione tra di loro. I segnali utili includono l'età del candidato, la provenienza mancante, i fallimenti della lettura persistente, la copertura del verificatore, le regressioni ombrali, i conflitti non risolti, la versione di banca attiva, la preparazione al rolloback e la deriva dei risultati post promozione. Non utilizzare il numero di elementi di memoria come metrica di salute del titolo. Tratta in modo diverso gli stati di attesa e di blocco. Un candidato in attesa di un revisore autorizzato non è violato se ha un proprietario e una scadenza. Un candidato ripetutamente estratto senza ottenere prove mancanti è bloccato. Un elemento attivo il cui verificatore non è disponibile è incerto. Un elemento attivo con una regressione critica verificata deve essere rimbalzato. Infine, mantenete le affermazioni sul prodotto oneste. Sidewisp è attualmente in anteprima privata. Il suo sito pubblico e il sistema di articoli sono in diretta, ma la raccolta di agenti di produzione sanità, gli adattatori runtime e il recupero automatico o guidato non vengono generalmente spediti. Il gate di questo articolo è un modello di operatore che si adatta al territorio sanitario di Sidewisp; non è una affermazione che Sidewisp attualmente monitorino ReasoningBank, promuovano le memorie o eseguono il rollback. La prossima mossa ragionevole è piccola: scegliere una famiglia di attività limitata, congelare una banca di base, aggiungere provenienza e ricevute ombrose alle memorie dei candidati e promuovere solo un articolo attraverso l'approvazione esplicita. Se il risultato rimane stabile, espandete la suite prima di espandere l'autorità.