2026-08-01T08:39:11.778Z
ReasoningBank: vérifier la mémoire auto-évolutive avant promotion
Transformez ReasoningBank en une passerelle de mémoire prête pour l'opérateur avec provenance, persistance, vérification indépendante, tests de régression de l'ombre et retour en arrière.
La réponse utile à ReasoningBank: L'agent d'échelle se développe lui même avec la mémoire de raisonnement n'est pas de laisser l'agent réécrire sa mémoire après chaque course. et a échoué les trajectoires. Un opérateur a encore besoin d'une règle distincte pour décider quand l'une de ces stratégies peut affecter le travail en direct. Utilisez la quarantaine par défaut. Gardez un nouvel élément de mémoire hors de récupération active jusqu'à ce que vous puissiez tracer son origine, prouver qu'il a été stocké correctement, vérifier le résultat source indépendamment lorsque cela est possible, le faire contre une suite d'ombre fixe, et retourner à la banque précédente si le comportement régresse. La promotion devrait être une décision explicite et non un effet secondaire de l'extraction. Cette limite préserve l'idée centrale du document tout en abordant une autre question: non pas si la mémoire de raisonnement peut améliorer les performances de référence, mais si une mise à jour de mémoire particulière est suffisamment saine pour influencer la tâche réelle suivante. Qu'est ce que la ReasoningBank contribue et qu'est ce qu'elle teste Le Le papier de la ReasoningBank remplace la réutilisation de la trajectoire brute par des mémoires de stratégie compactes. Chaque élément a un titre, une description en une phrase et un contenu contenant des étapes de raisonnement, des raisons de décision ou des leçons opérationnelles. La boucle a trois parties: 1. récupérer les éléments pertinents pour une nouvelle tâche; 2. juger de la trajectoire accomplie, puis tirer des leçons du succès ou de l'échec; 3. Consolider ces éléments dans la banque. Le chemin de l'échec compte. Une trajectoire de navigateur ratée peut donner une leçon préventive comme vérifier un identifiant de page avant de répéter une action de pagination. C'est plus réutilisable que de stocker une longue séquence de clics. Le L'explication de Google Research décrit la même boucle de récupération, d'extraction et de consolidation et rapporte des améliorations par rapport aux lignes de base de mémoire sans mémoire et antérieures sur WebArena et SWE Bench Verified. Ces résultats constituent une preuve de la méthode dans le cadre de l'installation évaluée et non une garantie de production. Le papier utilise un LLM as a judge pour étiqueter les trajectoires sans rétroaction de la vérité fondamentale. Les articles nouvellement extraits sont directement attachés, sans taille. La récupération est basée sur l'intégration de similitudes. Les auteurs gardent délibérément ces pièces simples afin d'isoler la valeur du contenu axé sur le raisonnement. Le projet référentiel de référence renforce la frontière: il publie le code WebArena et SWE Bench, tandis que son README indique que le projet est à démonstration et n'est pas destiné à la production. C'est un avertissement utile, pas un défaut. Une mise en œuvre de la recherche et un contrôle opérationnel résolvent différents problèmes. Contenu de mémoire séparé de l'autorité de promotion Le schéma ReasoningBanks {title, description, content} est lisible par l'homme et facile à injecter dans un prompt. Il ne nécessite pas d'identifiant de trajectoire source, de hachage d'extraction, de type de vérificateur, de version, d'expiration, de conflit, de résultat d'ombre, d'approbation ou de pointeur de retour. C'est approprié pour l'expérience. Elle est insuffisante en tant que seul record derrière un changement affectant la production. Envelopper chaque élément extrait dans une enveloppe de l'opérateur: Cette enveloppe ne rend pas la mémoire vraie. Cela rend la décision inspectable. Il sépare également cinq événements qui sont faciles à s'effondrer en un: l'extraction a été achevée, une écriture a réussi, l'article a survécu à une relire, les conseils ont aidé sur les cas d'ombre, et une personne autorisée a permis à la récupération active. La distinction est importante parce que l'activité n'est pas le progrès. Une banque de mémoire peut croître après chaque tâche alors que la qualité de récupération diminue. Dans l'ablation propre du document, l'utilisation d'une expérience pertinente a battu l'utilisation d'un ensemble plus grand; le succès a chuté lorsque 2, 3 et 4 expériences ont été récupérées dans cet environnement évalué. Le résultat ne définit pas un top k universel, mais il réfute une hypothèse de fonctionnement tentante: un matériau plus mémorable n'est pas automatiquement plus sain. Requérir cinq preuves avant la promotion Les cinq preuves ci dessous sont délibérément indépendantes. Un passage dans une colonne ne compense pas un échec dans une autre. 1. La provenance Enregistrer la trajectoire de la source, son résultat observé, le prompt ou la version d'extraction et un hash de l'élément induit. Une mémoire sans provenance devrait rester en quarantaine même si ses conseils semblent raisonnables. Dans le cas contraire, un opérateur ne peut pas distinguer une extraction courante d'une importation périmée, d'un article dupliqué ou d'une édition manuelle. 2. Persistance durable Ne comparez pas un appel écrit réussi à une mémoire conservée. Relire l'élément stocké à travers la même limite que l'exécution utilisera, comparer son hash et répéter le contrôle après le redémarrage ou la mise à jour de l'index pertinent. Un élément manquant ou modifié est un défaut de persistance; un chemin de lecture non disponible est unknown , pas sain. 3. Des preuves indépendantes des résultats L'article rapporte la robustesse pour juger du bruit, mais il énumère également la dépendance à LLM as a judge comme une limitation. Pour une promotion opérationnelle, préférer un vérificateur déterministe: hash de fichier attendu, test de réussite, état API, nombre de lignes ou autre reçu spécifique à la tâche. Utilisez l'examen humain lorsque le résultat ne peut pas être vérifié mécaniquement. Un verdict LLM peut donner la priorité à la révision, mais ne devrait pas être la seule autorité pour une mémoire qui change le comportement futur. 4. Régression de l'ombre et couverture de dérive Appliquez le candidat contre une suite versionnée sans le laisser affecter les tâches en direct. Incluez les cas où la stratégie devrait aider, les cas où elle devrait être irrélevante et au moins un cas limitatif où la surapplication serait préjudiciable. Comparer les résultats, pas la fluidité. Suivez la version bancaire, le modèle, les outils et la version de l'appareil afin qu'un changement ultérieur ne se masque pas comme une dérive de mémoire. Le seuil appartient au risque de la tâche. Le dispositif d'accompagnement utilise quatre cas et un taux de réussite de 80% uniquement pour rendre la règle de décision reproduisable; ces chiffres ne constituent pas une recommandation générale. Un outil destructeur peut nécessiter le passage de chaque cas critique. Un assistant de rédaction réversible peut tolérer une limite différente. 5. L'homologation explicite et la préparation au retour Passer les contrôles techniques signifie être "prêt à l'approbation" et non "promouvoir automatiquement". Après la promotion, réalisez un petit jeu de canaries et regardez les résultats vérifiés de la tâche. Si une régression critique apparaît, restaurer la version précédente d'abord; enquêter en deuxième. Reproduction de la règle de décision sur six cas d'inconvénient J'ai codé la passerelle comme un petit classifiateur Node.js et l'ai couru contre six candidats. La règle vérifie la provenance, un reçu de persistance écrit plus rélire, des preuves déterministiques ou humaines de résultats, une couverture d'ombre, des conflits de mémoire active et un pointeur de rétroaction. Il applique ensuite cette priorité: La commande est intentionnelle. Une régression active nécessite un renversement même si la promotion initiale a été approuvée. Les preuves manquantes ne peuvent pas être réparées par approbation. Un conflit n'est pas automatiquement un échec parce que deux stratégies peuvent avoir des objectifs différents, mais il a besoin d'une personne ou d'une règle déterministe plus forte avant l'activation. Exécutez l' appareil avec: La sortie fixe était: Le candidat Condition des preuves Décision mem 001 Aucune provenance; verdict du juge seulement quarantine mem 002 la provenance présente; le juge reste la seule preuve de l'issue quarantine mem 003 Toutes les preuves passent; conflits avec un élément actif review conflict mem 004 la preuve technique est passée; aucune autorisation de l'exploitant n'est accordée; ready for approval mem 005 toutes les preuves passent et l'approbation est enregistrée promote mem 006 l'élément actif ne parvient pas à la limite de l'ombre rollback Ce dispositif ajoute des informations que le papier n'essaie pas de fournir: une limite d'autorité concrète autour d'une seule mémoire induite. Il fait Znot reproduire les benchmarks du papier, valider chaque stratégie extraite, ou prouver qu'un score d'ombre de 80% se généralisera. Le changement de distribution peut encore vaincre la suite. Les conflits peuvent être subtils. L'approbation humaine peut toujours être erronée. Opérer la boucle sans prétendre qu'elle est résolue Un déploiement pratique de ReasoningBank devrait donc avoir deux banques, et non pas un pool non différencié: une banque de quarantaine qui accepte de nouveaux objets extraits et conserve leurs preuves; une banque active contenant uniquement des articles certifiés en version utilisés pour la récupération en direct. Mesurer la transition entre eux. Parmi les signaux utiles figurent l'âge du candidat, la provenance manquante, les défaillances de lecture persistante, la couverture des vérificateurs, les régressions de l'ombre, les conflits non résolus, la version active bank, la préparation au retour et la dérive des résultats post promotion. N'utilisez pas le nombre d'éléments de mémoire comme indicateur de santé du titre. Traiter les états d'attente et de blocage différemment. Un candidat en attente d'un réviseur autorisé ne sera pas cassé s'il a un propriétaire et une date limite. Un candidat qui a été retraité à plusieurs reprises sans avoir obtenu des preuves manquantes est coincé. Un élément actif dont le vérificateur devient indisponible est incertain. Un élément actif ayant une régression critique vérifiée doit être retiré. Enfin, gardez les allégations de produits honnêtes. Sidewisp est actuellement en préversion privée. Son site public et son système d'articles sont en direct, mais la collecte des agents de production, les adaptateurs de temps d'exécution et la récupération automatisée ou guidée ne sont généralement pas expédiées. La passerelle dans cet article est un modèle d'opérateur qui correspond au territoire de santé de Sidewisp; ce n'est pas une affirmation selon laquelle Sidewisp surveille actuellement ReasoningBank, favorise les souvenirs ou effectue un retour en arrière. La prochaine étape raisonnable est petite: choisir une famille de tâches limitées, geler une banque de base, ajouter des reçus provenant et de l'ombre aux souvenirs des candidats, et promouvoir un seul élément par l'approbation explicite. Si le résultat reste stable, élargir la suite avant d'étendre l'autorité.