2026-08-01T02:45:28.846Z

Agent Memory Benchmark: Überprüfen Sie die Lücken hinter einer Punktzahl

Map AMB, MemoryArena und STATE-Bench zu den Beweisen, die sie tatsächlich produzieren, und fügen dann Neustart-, Frische-, Konflikt- und Bestimmungskontrollen hinzu.

Ein agent Speicher Benchmark ist nur dann nützlich, wenn der Test mit dem Fehler übereinstimmt, den Sie erfassen müssen. Die Genauigkeit des Abrufs kann zeigen, dass das gespeicherte Material gefunden werden kann. Es kann nicht von selbst zeigen, dass das Gedächtnis einen Neustart überlebt hat, dass die neueste Version einen Konflikt gewonnen hat oder dass ein Agent das Gedächtnis benutzt hat, um das beabsichtigte äußere Ergebnis zu erzeugen. Die praktische Standardlage ist daher nicht Pick die höchste Punktzahl. Wählen Sie den Benchmark aus, dessen Methode Ihre riskante Entscheidung ausübt, halten Sie seine offengelegten Fragen sichtbar und führen Sie neben ihm einen kleinen Produktionskanar. Ich habe drei aktuelle Ansätze AMB, MemoryArena und STATE Bench gegen sieben Fragen geprüft. Keiner dokumentiert das gesamte Einsatzprogramm. Drei Benchmarks, drei verschiedene Beweismittel AMB dokumentiert eine vierstufige Pipeline: Dokumente einnehmen, Kontext abrufen, eine Antwort erzeugen und dann ein zweites Modell verwenden, um diese Antwort gegen goldene Antworten zu beurteilen. Es verfolgt die Abholungs und Einnahmezeit sowie die Genauigkeit, die Geschwindigkeit und die Token Kosten. Das macht AMB nützlich, wenn es um die Qualität und Wirtschaftlichkeit der Abrufe zwischen Speicher Anbietern geht. Seine Methode erklärt auch, warum agentic in einem Datensatznamen nicht ausreicht. Das dokumentierte Endereignis ist immer noch eine generierte Antwort und ein Richter Ergebnis. Das ist ein sinnvoller Ergebnisbeweis, aber es ist nicht das Gleiche, wenn man beobachtet, dass ein Agent ein Zielsystem richtig verändert. ErinnerungArena bewegt die Einheit von Beweisen in eine Memory Agent Environment Schleife. Seine 766 vom Menschen geschaffenen Aufgaben haben unterberechnete Unteraufgaben zwischen den Sitzungen. Spätere Aktionen hängen von Informationen und Feedback ab, die früher erworben wurden, über die Web Navigation, die begrenzte Planung, die fortschreitende Suche und die sequentielle Argumentation hinweg. Das Papier berichtet durchschnittlich von 57 Aktionsschritten pro Aufgabe. Dieser Entwurf beseitigt eine wirkliche Schwäche bei der Erinnerungs Nur Bewertung: Ein Agent kann eine Tatsache erfassen, aber sie nicht anwenden, wenn sich die Umwelt ändert. MemoryArena macht das Gedächtnis für spätere Aktionen wichtig. Eine mehrstufige Aufgabe ist jedoch nicht automatisch ein Prozess Neustart Test. Es sei denn, der Harness zerreißt die Speicherkomponente absichtlich und beweist nach dem Start einen haltbaren Zustand, bleibt die Beharrlichkeit eine separate Frage. Staatsbüro testet 450 staatliche Unternehmens Aufgaben in Reisen, Kundenservice und Einkaufen. Seine Agent Lern Spur kann wiederverwendbare Erinnerungen durch einen Abrufshaken liefern. Die wichtigsten Metriken sind die Aufgabesabschlusspass@1, Pass^5 über fünf Laufen, eine von LLM beurteilte Benutzererfahrungs Score und Kosten pro Aufgabe. Die Punktgrenze zählt. Microsoft s Beschreibung der Freisetzung sagt, dass staatliche Mutationsaufgaben deterministische Behauptungen gegen den endgültigen Umgebungszustand verwenden, während verfahrenstechnische und informative Aufgaben einen LLM Richter verwenden. Die Ergebnisse der Kontrollen des Staates Bänks sind korrekt; jeder Ergebnis des Staates Bänks ist deterministisch ist nicht. Halten Sie die Abdeckungsbedingungen anstelle einer Punktzahl herzustellen Ich habe jede dokumentierte Methode auf sieben Fragen beschrieben. Covered bedeutet, dass die Methode die Frage direkt ausübt. Partial bedeutet, dass es relevante Beweise liefert, aber keine vollständige Betriebsbehauptung enthält. Not documented bedeutet genau das; es ist keine Anschuldigung, dass ein Projekt einen solchen Test nicht durchführen kann. Beweisfrage AMB ErinnerungArena Staatsbüro Qualität der Abholung Abgedeckt Teilweise Teilweise Gedächtnis Guides für spätere Aktionen Teilweise Abgedeckt Abgedeckt Deterministisches endgültiges Ergebnis Teilweise Teilweise Teilweise Absichtliche Neustart Persistenz Nicht dokumentiert Teilweise Nicht dokumentiert Frische und Herkunft Nicht dokumentiert Nicht dokumentiert Nicht dokumentiert Zuverlässigkeit der Wiederholung Nicht dokumentiert Nicht dokumentiert Abgedeckt Kosten oder Effizienz Abgedeckt Nicht dokumentiert Abgedeckt Diese Tabelle darf nicht auf zwei von sieben oder fünf von sieben reduziert werden. Die Abdeckung ist nicht additiv. Wenn der Vorfall, den Sie befürchten, eine veraltete Rückerstattungsrichtlinie ist, die ein Update überlebt, kann die Wiederherstellungsgenauigkeit auf einem statischen Korpus und fünf stabile Aufgabenläufe sowohl grün sein, während der gefährliche Konflikt unberührt bleibt. Das Audit Artefact validiert die Matrix und listet jede unbekannte operative Frage auf, ohne eine zusammengesetzte Punktzahl zu berechnen: Die Anwendung dieser Regel gegen die produzierte Quelle unterstützte Matrix: Dieses Ergebnis ist gefälscht. Ein Benchmark kann seine Methode ändern, eine explizite Neustartfunktion hinzufügen, eine veränderte Herkunft verlangen oder einen Richter durch deterministische Bestimmungsansprüche ersetzen. Aktualisieren Sie die Matrix, wenn sich die öffentliche Methode ändert. Bewahren Sie kein altes undokumentiertes Etikett als Folklore. Wählen Sie nach dem Scheitern, nicht nach dem Ranking. Beginnen Sie mit der konkreten Entscheidung, die Sie nach dem Laufen treffen werden. Wenn Sie sich für einen Retrieval Anbieter entscheiden, sind die Aufnahme , Abrufen , Generieren und Richterdaten von AMB direkt nützlich. Führen Sie den gleichen Datensatz, die Domain, das Generationsmodell, den Richter Anruf und den Modus für jeden Anbieter aus. Seine README warnt, dass kleine Anforderung oder Modelländerungen die Genauigkeit um doppelte Ziffern verändern können, so dass ein Vergleich ohne diese Versionpins nicht reproduzierbar ist. Wenn Sie das Risiko haben, dass sich die Informationen im Gedächtnis befinden, aber sich das spätere Verhalten nicht ändert, verwenden Sie einen Aktions gekoppelten Test. Die wechselseitigen Unteraufgaben von MemoryArena machen frühere Informationen in späteren Sitzungen kausell notwendig. Bewahren Sie das Aufgabenmanifest und die Umgebungsversion und überprüfen Sie dann die erste Aktion, die nicht nur den endgültigen Aufgabenwert unterscheidet. Wenn die Entscheidung darüber ist, ob das Gedächtnis einen staatlichen Workflow konsequent verbessert, bietet STATE Bench eine stärkere Standardfunktion. Vergleichen Sie die Baseline ohne Speicher mit demselben Agent plus Speicher; halten Sie pass@1, pass^5, Kosten und den Scorer Typ getrennt. Ein Gewinn in der durchschnittlichen Fertigstellung zusammen mit einem Rückgang in der Pass^5 ist keine saubere Beförderung. Eine von LLM beurteilte Verfahrenspass ist auch nicht gleichbedeutend mit einer deterministischen Datenbankbehauptung. Diese Optionen können kombiniert werden. Ein kleines Team kann AMB ausführen, um eine zu ungenaue oder kostspielige Wiederherstellungsimplementierung zu beseitigen, dann eine fokussierte Aktions gekoppelte Suite ausführen und dann einen STATE Bench Untersatz für wiederholte Workflow Ergebnisse verwenden. Die Reihenfolge ist zu verteidigen, weil jede Stufe eine benannte Frage beantwortet. Eine gemischte Rangliste Nummer würde verbergen, warum ein Kandidat ausgezeichnet wurde. Die Einschränkung ist wichtig: Dieser Audit vergleicht dokumentierte Methoden; er führt nicht alle Benchmarks aus oder behauptet, dass undokumentierte private Tests nicht existieren. Synthetische Aufgaben, simulierte Benutzer, Evaluator Modelle, Domain Abdeckung und Repository Revisionen begrenzen alle, wie weit ein Ergebnis auf Ihre Arbeitsbelastung übertragen wird. Hinzufügen der Betriebskontrollen Benchmarks lassen offen Offline Beweise sollten an einer Beförderungsgrenze enden. Ein kompakter lebender Kanarier sollte dort anfangen. Verwenden Sie Inhaltsfreie Identifikatoren, wenn im echten Speicher privates Material enthalten kann. Schreiben Sie beispielsweise eine zufällige Kanarien ID, eine Version, einen Hash einer erwarteten Entscheidung und eine Ablaufzeit. Halten Sie die rohen Anfragen, Gespräche, Geheimnisse und Kundendaten aus dem Gesundheitsereignis. Dann laden Sie diese Kette: 1. AErkennen Sie den write. Erfassen Sie den Speichernamenraum, die Kanarien ID, die erwartete Version, die Adapterversion und den Schreibbeweis. Eine erfolgreiche HTTP Antwort ist kein Beweis dafür, dass der erforderliche Index oder der dauerhafte Speicher die Aufzeichnung akzeptiert hat. 2. Überschreiten Sie eine echte Neustartgrenze. Neustart den Speicherdienst, die Agentlaufzeit oder den Host Adapter, von dem Sie tatsächlich abhängen. Ein neues Gespräch innerhalb des gleichen Prozesses testet eine andere Grenze. 3. Lesen Sie mit Frische und Herkunft. Erfordern Sie die erwartete Version und eine überprüfbare Quellenreferenz. Ein semantisch plausibler älterer Wert ist ein Scheitern, nicht ein Naheverlust. 4. Injektieren Sie einen Konflikt. Schreiben Sie einen neueren Wert, behalten Sie den alten Identifikator und überprüfen Sie, ob der Resolver den beabsichtigten Gewinner zurückgibt. Aufzeichnen Sie, ob die Richtlinie zuletzt geschrieben, explizite Version, Quellenpriorität oder menschliche Genehmigung ist. 5. Erfordert eine Konsequenzaktion. Gib dem Agenten eine Aufgabe, bei der das richtige Werkzeugargument vom Kanarien abhängt. Überprüfen Sie das Argument oder den Statusübergang, nicht die Erklärung, die das Modell erzeugt. 6. Verifizieren Sie den Bestimmungsort. Lesen Sie das externe System oder das Artefakt, das die Fertigstellung darstellt. Kommando Ausgang, Tool Call Erfolg und vom Agenten gemeldeter Erfolg sind Aktivitätsnachweise. 7. Repeat innerhalb von Grenzen. Laufen Sie ausreichend gleichwertige Fälle aus, um Inkonsistenz zu erkennen, während Sie Modell , Prompts , Werkzeug und Umgebungsversionen fixieren. Spurenkosten neben dem bestätigten Ergebnis. Eine minimale Quittung kann so aussehen: Markieren Sie den Gedächtnisweg nicht gesund, wenn ein gewünschtes Feld nicht verfügbar ist. Geben Sie uncertain zurück, bewahren Sie die letzte bekannte Zeitspanne und lenken Sie das fehlende Signal an eine Person. Die sichere Reaktion auf unvollständige Beweise ist kein automatischer erneuter Versuch, der eine äußere Wirkung wiederholen kann. Eine Beförderungsregel, die Sie erklären können. Eine Gedächtnisänderung nur dann vorantreiben, wenn drei Aussagen zutreffen: die gewählte Benchmark führt direkt das Verhalten aus, das die Änderung motiviert hat; Wiederholte Ergebnisse verbessern oder halten die Qualität ohne die vereinbarte Kostengrenze zu verletzen; die Live Kanarie beweist, dass die Persistenz, die korrekte Version/Herkunft, die daraus resultierende Nutzung und das erwartete Zielresultat neu gestartet werden. Wenn eine Aussage nicht unterstützt wird, behalten Sie die Änderung in der Bewertung. Diese Regel ist absichtlich strenger als die Benchmark gestiegen ist, aber schmaler als der Aufbau einer universellen Evaluierungsplattform. Es gibt einem kleinen Team einen überprüfbaren Grund, weiterzumachen oder zu stoppen. Die Produktrichtung von Sidewisp behandelt fehlende Speicherlesen oder Schreiben, fehlende Persistenz bei Neustartungen, veraltete Synchronisierung, Resets, Kontextwachstum und verlorene Entscheidungen als Gesundheitssignale. Die Produktionsüberwachungsmaschine und die Laufzeitadapter werden nicht in der aktuellen Webseitenrepository versandt. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Wenn dieses Beweismodell übereinstimmt, wie Sie Agenten betreiben, können Sie sich der privaten Vorschau Warteliste anschließen, ohne Ihre Laufzeit zu ersetzen oder einen offline Benchmark als ein Live Gesundheitszertifikat zu behandeln.