2026-08-01T08:39:13.780Z
推广前审核自我发展记忆
转换ReasoningBank为一个操作员准备的内存网关,提供源头,持久性,独立验证,阴影回归测试和反弹.
对于 理性银行:自行发展的扩展剂与理性记忆 的有用答案是,不要让经纪人每次运行后重新写出记忆. 没有成功. 它们的轨迹. 运营商仍然需要一个单独的规则,以确定这些策略中的一个可能会影响现场工作. 使用隔离作为默认的. 保持一个新的内存项目,直到你能追踪它来自哪里,证明它是正确的存储, 独立验证原始结果, 提升应是明确的决定,而不是提取的副作用. 这一边界保留了论文的核心思想,同时解决了一个不同的问题:不是推理记忆能改善基准表现,而是某个特定的记忆更新是否足够健康以影响下一个真正任务. 理性银行所做出的贡献和测试 理性银行论文将原始轨迹重复使用取代于紧的战略记忆. 每个项目都有标题,一个句子的描述,内容包含推理步骤,决定的理由或操作教训. 循环有三个部分: 1. 获取有关新任务的项目; 2. 判断已完成的轨迹,然后从成功或失败中汲取教训; 3. 将这些项目归还到银行中. 失败之路是重要的. 一个失败的浏览器轨迹可能会产生预防性教训,例如在重复页面化操作之前检查页面标识符. 这比存储长时间的点击序列更容易重复使用. 谷歌研究解释描述了相同的检索,提取和整合循环,并在WebArena和SWE Bench Verified上报告了没有内存和早期内存基线的改进. 这些结果是评估的设置中方法的证据,而不是生产保证. 论文使用LLM作为法官来标记轨迹, 新提取的物品直接附加,不切割. 检索基于嵌入相似性. 作者故意把这些作品简单,以便他们能够分离出基于推理的内容的价值. 该项目的参考存储库加强了边界:它发布了WebArena和SWE Bench代码,而其README表示该项目是用于示范而不是用于生产. 这是一个有用的警告,而不是一个缺陷. 研究实施和操作控制解决了不同的问题. 从促销机构分离内存内容 理由Bank的 {title, description, content} 方案是人能读取的,并且很容易注入一个提示. 它不需要源轨迹ID,提取哈希,验证器类型,版本,过期,冲突设置,阴影结果,批准或反转指针. 这对于实验来说是合适的. 由于生产变化的唯一记录,这一数据不足. 包装每种提取的物品在操作员包裹中: 这封信并不能让记忆成为真实的. 这使得决定可以检查. 它还将五个容易被分解成一个事件分开:提取完成,写作成功,物件幸存下来, 区别是重要的,因为活动不是进步. 每个任务后,一个存储库可以成长,而检索质量却会下降. 在论文中,使用一个相关的经验比使用更大的集合;成功下降了 2, 3 和 4 经验在该评估环境中得到回收. 结果并未定义通用 top k ,但它驳斥了一个诱惑性操作假设:记得更多的材料不会自动更健康. 在晋升之前需要五份证据 下面的五种证据是故意独立的. 一个列的通过不会弥补另一个列的失败. 1. 产地 记录源轨迹,其观察结果,提取提示或版本,以及诱导项的哈希. 记忆不出生的应该保持隔离,即使它的建议听起来很合理. 否则,运营商无法区分当前提取物与过时进口物,复制物或手动编辑物. 2. 持续性 不要把成功的写通话与保留的记忆等同. 通过运行时间将使用的相同边界重新阅读存储的项目,将其哈希进行比较,并在相关重启或索引更新后重复检查. 缺失或更改的项目是持续性故障;不可用的读路是 unknown ,不健康. 3. 独立的结果证据 该论文报告了对噪音判断的强度,但它还列出了对LLM as a judge的依赖作为限制. 对于操作推广,更好使用确定性验证器:预期文件哈希,通过测试,API状态,行数量或其他特定任务的收据. 如果无法机械检查结果,请使用人体检查. 一个LLM判决可以优先考虑审查,但不应该是唯一改变未来行为的记忆的权威. 4. 阴影回归和漂移覆盖 运行候选人对付一个版本的套件,而不让它影响现场任务. 包括战略应有帮助的案例,不相关的案例以及过度应用会造成伤害的至少一个边界案例. 比较结果,而不是流利. 追踪银行版本,模型,工具和固定版本,以免后的更改伪装为记忆漂移. 值属于任务的风险. 附加装置仅使用四个案例和80%的通过率,使得决策规则可复制;这些数字不是一般建议. 一个破坏性的工具可能需要通过每一个关键的案例. 一个可逆的起草助理可以容忍不同的界限. 5. 显而易见的批准和回滚准备 通过技术检查意味着 准备获得批准,而不是 自动推广. 升级后,再播放一个小的鱼集, 如果出现关键回归,首先恢复以前的版本;第二次调查. 复制6起不方便案件的决定规则 我将这门编码为一个小的 Node.js 分类器, 规则检查来源,写加再阅读持久收件,确定性或人类结果证据,阴影覆盖,活性记忆冲突和反转指针. 然后,它应对以下优先事项: 订单是故意的. 积极回归需要回调,即使最初的提升已获得批准. 没有证据不能通过批准修复. 冲突不是自动失败,因为两个策略可能具有不同的范围,但它需要一个人或更强大的确定性规则在激活之前. 使用: 固定输出是: 候选人 证据的条件 决策 mem 001 没有来源; 只有法官的判决 quarantine mem 002 现有来源;法官仍然是唯一的结果证据 quarantine mem 003 所有证据都通过了;与活性项目发生冲突 review conflict mem 004 经过技术证明;没有经营者批准 ready for approval mem 005 所有证据都通过,批准记录 promote mem 006 现在的主动项目失败了阴影界限 rollback 这种装置添加了论文未试图提供的信息:一个单一的诱导记忆周围的具体权威界限. 它是否使 Xnot 复制论文的基准,验证每一个提取的策略,或证明80%的阴影分数将普遍化. 配分转移仍然可以击败套房. 冲突可能是微妙的. 人的认可仍然可能是错误的. 运行循环而不假装它已经解决 因此,实际推广理性银行应该有两个银行,而不是一个不分区分的库: 一个接受新提取物品并保存其证据的隔离银行; 一个活跃的银行,只包含使用现场检索的版本,批准的项目. 测量它们之间的过渡. 有用的信号包括候选人的年龄,缺失来源,持续阅读失败,验证器覆盖,阴影回归,未解决的冲突,主动银行版本,反弹准备以及促销后的结果漂移. 不要用记忆物数作为标题健康指标. 待待和停留的状态是不同的. 候选人等待授权审查员,如果有主人和截止日期,就不会被打破. 一个被反复提取的候选人, 一个有效项目,其验证器无法使用,是不确定的. 一个具有验证的关键回归的活性项目应被回滚. 最后,让产品的索赔保持诚实. Sidewisp 目前处于私密预览阶段。 它的公共网站和文章系统是现场的,但生产代理 健康收集,运行时间适配器和自动化或指导恢复通常不出货. 本文中的门是一个适合Sidewisp健康领域的操作模式;它不是说Sidewisp目前监控理性银行,促进记忆,或执行反弹. 下一个合理的举动是小的:选择一个有限的任务家族, 结一个基线银行, 添加来自和影子收据到候选人记忆, 如果结果保持稳定, 在扩大权威之前扩大套件.