2026-08-01T08:39:11.102Z

ReasoningBank: Audit des sich selbst entwickelnden Gedächtnisses vor der Beförderung

Verwandeln Sie ReasoningBank in ein für den Betreiber bereites Speichertor mit Herkunft, Persistenz, unabhängiger Verifizierung, Schattenregressions-Tests und Rollback.

Die nützliche Antwort auf ReasoningBank: Scaling Agent Self Evolving with Reasoning Memory ist nicht Lassen Sie den Agent sein Gedächtnis nach jedem Lauf neu schreiben. Das Papier stellt eine vielversprechende Möglichkeit dar, Strategien aus erfolgreichen und gescheiterten Trajektorien zu distillerieren. Ein Betreiber benötigt immer noch eine separate Regel, um zu entscheiden, wann eine dieser Strategien die Live Arbeit beeinflussen kann. Verwenden Sie die Quarantäne als Standard. Halten Sie ein neues Speicher Element aus der aktiven Abrufung, bis Sie nachvollziehen können, woher es kam, beweisen, dass es richtig gespeichert wurde, überprüfen Sie das Quellresultat unabhängig, wo möglich, laufen Sie es gegen eine feste Schattensuite und kehren Sie zur vorherigen Bank zurück, wenn das Verhalten zurückgreift. Die Beförderung sollte eine explizite Entscheidung sein, nicht ein Nebenwirkungen der Extraktion. Diese Grenze bewahrt die zentrale Idee des Papiers, während sie eine andere Frage anspricht: nicht, ob das Argumentationsgedächtnis die Benchmark Leistung verbessern kann, sondern ob ein bestimmtes Gedächtnis Update gesund genug ist, um die nächste echte Aufgabe zu beeinflussen. Was die ReasoningBank leistetund was sie prüft Das Papier der ReasoningBank ersetzt die Wiederverwendung der Rohbahn durch kompakte Strategie Erinnerungen. Jeder Punkt hat einen Titel, eine Beschreibung in einem Satz und einen Inhalt mit Argumentationsschritten, Entscheidungsgründe oder operativen Lektionen. Die Schleife besteht aus drei Teilen: 1. die relevanten Elemente für eine neue Aufgabe abrufen; 2. Beurteilen Sie den abgeschlossenen Ablauf und ziehen Sie dann aus dem Erfolg oder dem Scheitern Lektionen; 3. Diese Posten werden wieder in die Bank konsolidiert. Der Weg zum Scheitern zählt. Eine fehlerhafte Browserbahn kann eine vorbeugende Lektion wie die Überprüfung eines Seiten Identifikators vor der Wiederholung einer Paginierungsaktion geben. Das ist wiederverwendbarer als eine lange Folge von Klicks zu speichern. Das Erläuterung von Google Research beschreibt die gleiche Abruf , Extraktions und Konsolidierungsschleife und berichtet über Verbesserungen gegenüber Speicherfreien und früheren Speicherbasislinien auf WebArena und SWE Bench Verified. Diese Ergebnisse sind Beweise für die Methode innerhalb der bewerteten Einrichtung und keine Produktionsgarantie. Das Papier verwendet einen LLM as a Judge, um Träger ohne Grundwahrheit zu kennzeichnen. Neu gewonnenen Gegenstände werden ohne Beschneiden direkt angeschlossen. Die Wiederherstellung basiert auf der Einbindung von Ähnlichkeiten. Die Autoren halten diese Stücke bewusst einfach, damit sie den Wert von redensorientierter Inhalte isolieren können. Das Projekt s Referenzrepository stärkt die Grenze: Es veröffentlicht WebArena und SWE Bench Code, während sein README sagt, dass das Projekt zur Demonstration dient und nicht zur Produktion bestimmt ist. Das ist eine nützliche Warnung, nicht ein Fehler. Eine Forschungsimplementierung und eine Betriebskontrolle lösen verschiedene Probleme. Separate Speicherinhalte von der Förderbehörde Das Schema von ReasoningBanks {title, description, content} ist menschlich lesbar und leicht in eine Anforderung zu injizieren. Es erfordert keine Quellbahn ID, einen Extraktions Hash, einen Verifiziertyp, eine Version, eine Ablaufzeit, einen Konflikt, ein Schattenergebnis, einen Genehmigungs oder Rückschlagzeiger. Das ist für das Experiment angemessen. Sie ist als einziges Ergebnis einer Veränderung der Produktion unzureichend. Verpacken Sie jeden entnommenen Artikel in einen Betreiberumschlag: Dieser Umschlag macht die Erinnerung nicht wahr. Das macht die Entscheidung überprüfbar. Es trennt auch fünf Ereignisse, die leicht in einen zusammenbrechen können: Extraktion ist abgeschlossen, ein Schreiben erfolgreich, das Element überlebt eine Wiederlesung, der Rat geholfen bei Schattenfällen, und eine autorisierte Person erlaubt es in aktive Abholung. Die Unterscheidung ist wichtig, weil Aktivität kein Fortschritt ist. Eine Speicherbank kann nach jeder Aufgabe wachsen, während die Wiederherstellungsqualität abnimmt. In der eigenen Ablation des Papiers schlägt die Verwendung einer relevanten Erfahrung die Verwendung größerer Sätze; der Erfolg fiel, als 2, 3 und 4 Erfahrungen in dieser bewerteten Einstellung abgerufen wurden. Das Ergebnis definiert kein universelles top k , aber es widerlegt eine verlockende Betriebsvorstellung: mehr erinnertes Material ist nicht automatisch gesünder. Sie müssen fünf Beweise vor der Beförderung verlangen. Die folgenden fünf Beweise sind absichtlich unabhängig. Ein Pass in einer Spalte kompensiert keinen Fehler in einer anderen Spalte. 1. Herkunft Aufzeichnen Sie die Quellbahn, das beobachtete Ergebnis, die Extraktionsanforderung oder version sowie einen Hash des induzierten Gegenstands. Ein Gedächtnis ohne Herkunft sollte in Quarantäne bleiben, auch wenn sein Rat vernünftig klingt. Ansonsten kann ein Betreiber eine aktuelle Extraktion nicht von einer veralteten Einfuhr, einem duplizierten Artikel oder einer manuellen Bearbeitung unterscheiden. 2. Dauerhafte Beständigkeit Vergleichen Sie einen erfolgreichen Schreibruf nicht mit einem gespeicherten Speicher. Lesen Sie den gespeicherten Artikel durch die gleiche Grenze, die die Laufzeit verwendet, vergleichen Sie seinen Hash und wiederholen Sie die Prüfung nach dem entsprechenden Neustart oder Index Erneuerung. Ein fehlender oder geändertes Element ist ein Persistenzfehler; ein nicht verfügbarer Lesweg ist unknown , nicht gesund. 3. Unabhängige Ergebnisnachweise Das Papier berichtet über die Robustheit, um Lärm zu beurteilen, listet aber auch die Abhängigkeit von LLM as a Judge als Einschränkung auf. Für eine operative Aktualisierung bevorzugen Sie einen deterministischen Verifikator: erwartete Dateihasche, Pass Test, API Zustand, Zeilenzahlen oder eine andere auf die Aufgabe spezifische Anmeldung. Verwenden Sie menschliche Überprüfung, wenn das Ergebnis nicht mechanisch überprüft werden kann. Ein LLM Urteil kann die Überprüfung priorisieren, sollte aber nicht die einzige Autorität für ein Gedächtnis sein, das zukünftiges Verhalten verändert. 4. Schattenregression und Drift Abdeckung Führen Sie den Kandidaten gegen eine Version Suite aus, ohne dass sie Live Aufgaben beeinflusst. Es sind Fälle, in denen die Strategie hilfreich sein sollte, Fälle, in denen sie irrelevant sein sollte, und mindestens ein Grenzfall, in dem eine übermäßige Anwendung schädlich wäre. Vergleichen Sie die Ergebnisse, nicht die Flüssigkeit. Überwachen Sie die Bankversion, das Modell, die Werkzeuge und die Fixturversion, damit eine spätere Änderung nicht als Speicherdrift verkleidet wird. Die Schwelle gehört zum Risiko der Aufgabe. Die Begleitregelung verwendet nur vier Fälle und eine Übergangsrate von 80% um die Entscheidungregel reproduzierbar zu machen; diese Zahlen sind keine allgemeine Empfehlung. Ein zerstörerisches Werkzeug kann jeden kritischen Fall durchlaufen lassen. Ein umkehrbarer Schreibassistent kann eine andere Grenze tolerieren. 5. Ausdrückliche Genehmigung und Rücklaufbereitschaft Durch die technische Überprüfung bedeutet bereit für die Genehmigung, nicht automatisch zu bewerben. Die vorherige Bank bleibt unveränderlich, wird die aktive Version aufgenommen und das Signal definiert, das den Rückgang auslösen wird. Nach der Beförderung laufen Sie ein kleines Kanarien Set wieder und beobachten Sie die bestätigten Aufgabenergebnisse. Wenn eine kritische Regression auftritt, stellt die vorherige Version zuerst wieder her; untersucht zweitens. Wiederholen Sie die Entscheidungregel in sechs unangenehmen Fällen Ich habe das Tor als einen kleinen Node.js Klassifikator verschlüsselt und es gegen sechs Kandidaten ausgeführt. Die Regel überprüft die Herkunft, eine Aufrechterhaltserklärung über das Schreiben und das Wiederlesen, deterministische oder menschliche Ergebnisbeweise, Schattendeckung, Konflikte mit dem aktiven Gedächtnis und einen Rückschlagzeiger. Es gilt dann diese Vorrangsregelung: Die Bestellung ist absichtlich. Eine aktive Regression erfordert einen Rückgang, auch wenn die ursprüngliche Beförderung genehmigt wurde. Fehlende Beweise können nicht durch Genehmigung behoben werden. Ein Konflikt ist nicht automatisch ein Scheitern, weil zwei Strategien unterschiedliche Bereiche haben können, aber es braucht eine Person oder eine stärkere deterministische Regel vor der Aktivierung. Führen Sie das Gerät mit: Die feste Ausgabe war: Bewerber Beweisbedingungen Entscheidung mem 001 Keine Herkunft; nur ein Richter entscheidet. quarantine mem 002 die Herkunft vorhanden ist; der Richter bleibt der einzige Ergebnisbeweis quarantine mem 003 alle Beweise bestehen; Konflikte mit einem aktiven Element review conflict mem 004 Überprüfung der technischen Nachweise; keine Genehmigung des Betreibers ready for approval mem 005 alle Beweise bestehen und die Genehmigung wird aufgezeichnet promote mem 006 Aktives Element entfällt nun in der Schattengrenze rollback Dieses Gerät fügt Informationen hinzu, die das Papier nicht bereitstellen will: eine konkrete Autoritätsgrenze um ein einziges induziertes Gedächtnis. Znot reproduziert die Papiers Benchmarks, validiert jede extrahierte Strategie oder beweist, dass ein 80% Schatten Score verallgemeinert wird. Die Verteilungsschicht kann die Suite immer noch besiegen. Konflikte können subtil sein. Die menschliche Zustimmung kann immer noch falsch sein. Bearbeiten Sie die Schleife ohne zu tun, als wäre sie gelöst. Eine praktische Einführung der ReasoningBank sollte daher zwei Banken und nicht einen undifferentierten Pool umfassen: eine Quarantänebank, die neue gewonnenen Gegenstände akzeptiert und ihre Beweise bewahrt; eine aktive Bank, die nur Versionen von genehmigten Artikeln enthält, die bei der Live Entnahme verwendet werden. Messen Sie den Übergang zwischen ihnen. Zu den nützlichen Signalen gehören das Alter des Kandidaten, fehlende Herkunft, Ausfälle bei der Persistenzlesung, Verifikatorabdeckung, Schattenregressionen, ungelöste Konflikte, Active Bank Version, Rücklaufbereitschaft und Ergebnisdrift nach der Beförderung. Verwenden Sie nicht die Anzahl der Speicher Elemente als Überschrift Gesundheitsmetrik. Wartungs und Steckzustände behandelt man anders. Ein Kandidat, der auf einen autorisierten Prüfer wartet, wird nicht gebrochen, wenn er einen Eigentümer und eine Frist hat. Ein Kandidat, der wiederholt extrahiert wurde, ohne fehlende Beweise zu erhalten, bleibt fest. Ein aktiver Bestandteil, dessen Überprüfer nicht verfügbar ist, ist unsicher. Ein aktiver Bestandteil mit einer überprüften kritischen Regression sollte zurückgerollt werden. Und schließlich: Halten Sie die Produktansprüche ehrlich. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine öffentliche Website und das Artikelsystem sind live, aber die Produktion Agent Gesundheit Sammlung, Laufzeit Adapter und automatisierte oder geführte Wiederherstellung werden im Allgemeinen nicht versandt. Das Tor in diesem Artikel ist ein Betreibermuster, das dem Gesundheitsgebiet von Sidewisp entspricht; es ist keine Behauptung, dass Sidewisp derzeit ReasoningBank überwacht, Erinnerungen fördert oder Rollback durchführt. Der nächste vernünftige Schritt ist klein: Wählen Sie eine begrenzte Aufgabenfamilie aus, eingefrieren Sie eine Basisbank, fügen Sie den Kandidaten Erinnerungen Herkunft und Schattenquittungen hinzu und bewerben Sie nur ein Element durch explizite Genehmigung. Wenn das Ergebnis stabil bleibt, erweitern Sie die Suite, bevor Sie die Autorität erweitern.