2026-08-01T02:45:29.521Z
Benchmark de mémoire de l'agent: vérifier les lacunes derrière un score
Mettez AMB, MemoryArena et STATE-Bench dans les preuves qu'ils produisent réellement, puis ajoutez des contrôles de redémarrage, de fraîcheur, de conflit et de destination.
Une référence de mémoire agent n'est utile que lorsque son test correspond à l'échec que vous devez détecter. La précision de la récupération peut montrer que le matériel stocké est retrouvable. Il ne peut pas, par lui même, montrer que la mémoire a survécu à un redémarrage, que la version la plus récente a gagné un conflit, ou qu'un agent a utilisé la mémoire pour produire le résultat externe prévu. Le défaut pratique n'est donc pas choisir le score le plus élevé. Choisir le critère de référence dont la méthode exerce votre décision la plus risquée, garder ses questions découvertes visibles et faire fonctionner un petit canary de production à côté. J'ai vérifié trois approches actuelles AMB, MemoryArena et STATE Bench contre sept questions. Aucun n'a documenté l'ensemble de l'opération. Trois critères de référence, trois unités de preuve différentes L'AMB documente un pipeline en quatre étapes: ingérer des documents, récupérer le contexte, générer une réponse, puis utiliser un deuxième modèle pour juger cette réponse par rapport aux réponses en or. Il suit le temps de récupération et d'ingestion ainsi que la précision, la vitesse et le coût des jetons. Cela rend l'AMB utile lorsque la décision concerne la qualité et l'économie de la récupération entre les fournisseurs de mémoire. Sa méthode explique également pourquoi agentic dans le nom d'un ensemble de données n'est pas suffisant. L'événement terminal documenté est toujours une réponse générée et un résultat d'un juge. C'est une preuve significative des résultats, mais ce n'est pas la même chose que d'observer un agent modifier correctement un système de destination. La mémoireArena déplace l'unité de preuve dans une boucle de mémoire agent environnement. Ses 766 tâches créées par l'homme ont des sous tâches interdépendantes entre les sessions. Les actions ultérieures dépendent des informations et des commentaires obtenus plus tôt, à travers la navigation Web, la planification restreinte, la recherche progressive et le raisonnement séquentiel. Le document rapporte en moyenne 57 étapes d'action par tâche. Cette conception aborde une véritable faiblesse de l'évaluation uniquement par rappel: un agent peut récupérer un fait mais ne peut pas l'appliquer lorsque l'environnement change. MemoryArena rend la mémoire conséquente pour l'action ultérieure. Cependant, une tâche de plusieurs sessions n'est pas automatiquement un test de redémarrage du processus. À moins que le harnais ne déchire délibérément le composant de mémoire et ne prouve un état durable après le démarrage, la persistance reste une question distincte. Règlement de l'État teste 450 tâches d'entreprise étendues sur les voyages, l'assistance à la clientèle et les achats. Sa piste d'apprentissage des agents peut fournir des souvenirs réutilisables à travers un crochet de récupération. Les indicateurs principaux sont la réussite des tâches@1, la réussite^5 sur cinq tours, un score de l'expérience utilisateur jugé par LLM et le coût par tâche. La limite de marque est importante. Microsoft description de la libération dit que les tâches de mutation d'état utilisent des affirmations déterministes contre l'état final de l'environnement, tandis que les tâches procédurales et d'information utilisent un juge LLM. Les résultats des contrôles de l'État banque sont exacts; toutes les résultats de l'État banque ne sont pas déterministes. Garder les états de couverture au lieu de fabriquer un score J'ai cartographié chaque méthode documentée à sept questions. Covered signifie que la méthode exerce directement la question. Partial signifie qu'il fournit des éléments de preuve pertinents, mais qu'il ne répond pas à la demande opérationnelle complète. Not documented signifie exactement cela; ce n'est pas une accusation qu'un projet ne peut pas exécuter un tel test. Question de preuve L'AMB La mémoireArena Règlement de l'État Qualité de récupération Couverts Partie Partie La mémoire guide l'action ultérieure Partie Couverts Couverts Résultat final déterministe Partie Partie Partie Persistance au redémarrage délibéré Non documenté Partie Non documenté Fraîcheur et provenance Non documenté Non documenté Non documenté La fiabilité des opérations répétées Non documenté Non documenté Couverts Coût ou efficacité Couverts Non documenté Couverts Ce tableau ne doit pas être réduit à 2 sur 7 ou 5 sur 7. La couverture n'est pas additive. Si l'incident que vous craignez est une politique de remboursement périmée survivant à une mise à jour, la précision de récupération sur un corpus statique et cinq opérations stables peuvent être à la fois vertes pendant que le conflit dangereux reste intact. L'artefact d'audit valide la matrice et énumère toutes les questions opérationnelles non couvertes sans calculer un score composé: L'exécution de cette règle contre la matrice soutenue par la source produite: Ce résultat est falsifiable. Un indice de référence peut modifier sa méthode, ajouter une fixation explicite de redémarrage, exiger une provenance versionnée ou remplacer un juge par des affirmations déterministes de destination. Mettez à jour la matrice lorsque la méthode publique change. Ne conservez pas une ancienne étiquette non documentée comme folklore. Choisissez par l'échec, pas par le classement Commencez par la décision concrète que vous prendrez après la course. Si vous choisissez un fournisseur de récupération, les données d'ingestion/récupération/génération/jugement et de timing de l'AMB sont directement utiles. Exécutez le même ensemble de données, domaine, modèle de génération, demande de jugement et mode pour chaque fournisseur. Son README prévient que de petits changements de prompt ou de modèle peuvent déplacer la précision de deux chiffres, de sorte qu'une comparaison sans ces broches de version ne peut pas être reproduite. Si votre risque est que l'information mémorisée soit disponible mais ne modifie pas le comportement ultérieur, utilisez un test associé à l'action. Les sous tâches interdépendantes de MemoryArena rendent les informations antérieures causellement nécessaires dans les sessions ultérieures. Préserver le manifeste de tâches et la version de l'environnement, puis inspecter la première action qui diverge pas seulement du score final de la tâche. Si la décision est de savoir si la mémoire améliore constamment un flux de travail d'état, STATE Bench offre une défaillance plus forte. Comparez la ligne de base sans mémoire avec le même agent plus mémoire; gardez le pass@1, le pass^5, le coût et le type de scorer séparés. Une augmentation de la moyenne d'achèvement parallèlement à une baisse du passage n'est pas une promotion nette. Une certification procédurale jugée par LLM n'est pas non plus équivalente à une affirmation de base de données déterministe. Ces options peuvent être combinées. Une petite équipe peut exécuter AMB pour éliminer une mise en œuvre de récupération trop inexacte ou coûteuse, puis exécuter une suite axée sur l'action, puis utiliser un sous ensemble STATE Bench pour les résultats de flux de travail répétés. La séquence est défendable parce que chaque étape répond à une question nommée. Un numéro de classement combiné cacherait pourquoi un candidat a passé. La limitation est importante: cette vérification compare les méthodes documentées; elle ne répète pas tous les critères de référence ni ne prétend qu'il n'existe pas de tests privés non documentés. Les tâches synthétiques, les utilisateurs simulés, les modèles d'évaluation, la couverture des domaines et les révisions du référentiel limitent la portée d'un résultat sur votre charge de travail. Ajoutez les contrôles opérationnels des points de référence laissez ouvert Les preuves hors ligne devraient se terminer à une limite de promotion. Un canary vivant compact devrait commencer là bas. Utilisez des identifiants sans contenu lorsque la mémoire réelle peut contenir du matériel privé. Par exemple, écrivez un identifiant canarien aléatoire, une version, un hash d'une décision attendue et un délai d'expiration. Gardez les données sur la demande, la conversation, le secret et les clients hors de l'événement de santé. Alors, lancez cette chaîne: 1. Aconnaître l'écriture. Enregistrer l'espace de noms de mémoire, l'identifiant canarien, la version attendue, la version de l'adaptateur et l'écriture du reçu. Une réponse HTTP réussie n'est pas la preuve que l'index requis ou le magasin durable a accepté l'enregistrement. 2. Cross une limite de redémarrage réelle. Redémarrer le service de mémoire, l'heure d'exécution de l'agent ou l'adaptateur hôte dont vous dépendrez réellement. Démarrer une nouvelle conversation au sein du même processus teste une frontière différente. 3. Lire avec fraîcheur et provenance. Exiger la version attendue et une référence de source inspectable. Une valeur ancienne sémantiquement plausible est un échec, pas une erreur proche. 4. Inject a conflict. Écrire une valeur plus récente, conserver l'ancien identifiant, et vérifier que le résolveur retourne le gagnant prévu. Enregistrez si la politique est rédigée à la fin, une version explicite, une priorité de la source ou une approbation humaine. 5. Require une action conséquente. Donner à l'agent une tâche où l'argument de l'outil correct dépend du canary. Vérifiez l'argument ou la transition d'état, et non l'explication que produit le modèle. 6. Vérifier la destination. Lire le système externe ou l'artefact qui représente l'achèvement. La sortie du commandement, le succès de l'appel à l'outil et le succès rapporté par l'agent sont des preuves d'activité. 7. Repeat dans les limites. Exécuter suffisamment de cas équivalents pour révéler l'incohérence, tout en fixant les versions du modèle, du prompt, de l'outil et de l'environnement. Le coût de suivi à côté du résultat vérifié. Un reçu minimal peut ressembler à ceci: Ne marquez pas le chemin de mémoire sain si un champ requis n'est pas disponible. Retour uncertain , préserver le dernier temps de preuve connu, et diriger le signal manquant à une personne. La réponse sûre à des preuves incomplètes n'est pas une reprise automatique pouvant répéter un effet externe. Une règle de promotion que vous pouvez expliquer Promouvoir un changement de mémoire seulement lorsque trois déclarations sont toutes vraies: l'indice de référence choisi exerce directement le comportement qui a motivé le changement; les résultats répétés améliorent ou maintiennent la qualité sans violer la limite de coûts convenue; le canary vivant prouve la persistance du redémarrage, la version/l'origine correcte, l'utilisation conséquente et le résultat attendu de destination. Si une déclaration n'est pas soutenue, conservez le changement dans l'évaluation. Cette règle est délibérément plus stricte que lorsque l'indice de référence a augmenté, mais plus étroite que la création d'une plateforme d'évaluation universelle. Cela donne à une petite équipe une raison vérifiable de procéder ou d'arrêter. La direction du produit Sidewisp traite les lectures ou l'écriture manquantes de mémoire, la persistance échouée lors des redémarrages, la synchronisation obsolète, les réinitialisations, la croissance du contexte et les décisions perdues comme signaux de santé. Le moteur de surveillance de la production et les adaptateurs de temps d'exécution ne sont pas expédiés dans le référentiel actuel du site Web. Sidewisp est actuellement en préversion privée. Si ce modèle de preuve correspond à la façon dont vous opérez avec des agents, vous pouvez rejoindre la liste d'attente d'avant première privée sans remplacer votre horaire d'exécution ou traiter un indice de référence hors ligne comme un certificat de santé en direct.