2026-08-01T02:45:31.674Z
经纪人记忆基准:审核一个分数背后的差距
然后添加重新启动,新鲜度,冲突和目的地检查.
一个 agent内存基准 只有在它的测试匹配需要捕获的故障时才有用. 检索准确性可以证明存储的材料可以找到. 它本身不能表明记忆存活了重启, 最新版本赢得了冲突, 因此,实际的默认不是选取最高分数.选取最有风险的决策方法的基准指标,将其未揭露的问题视为可见,并在旁边运行一个小型的生产鱼. 我对7个问题进行了审计. 没有一个记录了整个操作集. 三个基准标准,三个不同的证据单位 其他类型记录了四个阶段的管道:摄入文件,检索文本,生成答案,然后使用第二个模型来判断答案与黄金答案. 它跟踪检索和摄入时间以及准确性,速度和代币成本. 这使得AMB有用,当决定在内存提供商之间检索质量和经济性时. 它的方法也解释了为什么数据集名称中的代理不够. 记录的终端事件仍然是一个生成的答案和一个法官的结果. 这是一个有意义的结果证据, 记忆Arena将证据单元移动到记忆 代理 环境循环中. 它的766个由人造的任务在各个会议中相互依赖的子任务. 后续行动取决于以前获得的信息和反,在网页导航,限制的规划,进步搜索和序列推理中. 报告每项任务平均有57个行动步骤. 这种设计解决了只召回评估的真正弱点:一个代理人可以检索一个事实,但当环境发生变化时无法应用它. 记忆Arena使记忆成为后续行动的结果. 然而,多次会议任务并不是自动重新启动过程的测试. 除非连接器故意拆除内存组件,并且在启动后证明了持久状态,否则持久性仍然是一个独立的问题. 在旅游,客户支持和购物领域,国家法庭测试了450个企业任务. 它的代理学习轨道可以通过检索提供可重复使用的记忆. 标题指标是任务完成通过@1,通过^5在五次运行中,LLM评判的用户体验分数,每项任务的成本. 进球界限是重要的. 微软的释放的描述表示,状态变化任务使用对最终环境状态的确定性断言,而程序和信息任务使用LLM法官. STATE Bench检查结果是准确的; 每一个State Bench检查结果都是确定性的不是. 保持覆盖状态,而不是制造一个分数 我把每种记录的方法都绘制成七个问题. " Covered "是指该方法直接执行问题. Partial 意味着它提供了相关证据,但没有完整的运营索赔. 这就是 Not documented 的意思;这不是指责一个项目不能进行这样的测试. 证据问题 其他类型 记忆Arena 国家法庭 检索质量 覆盖 部分 部分 记忆指导后续行动 部分 覆盖 覆盖 确定性最终结果 部分 部分 部分 故意重新启动的持续性 无文档 部分 无文档 新鲜性和来源 无文档 无文档 无文档 连续运行可靠性 无文档 无文档 覆盖 成本或效率 覆盖 无文档 覆盖 这表不应缩小到七中二或七中五. 如果您担心的事件是退款政策, 更新后, 恢复精度在静态数据库和五个稳定的任务运行都可能是绿色的, 而危险的冲突仍然没有受到影响. 审计器件验证矩阵,并列出所有未被发现的操作问题,而不计算复合分数: 运行该规则与生成的源支持矩阵相比: 这种结果是可伪造的. 一个基准值可以改变其方法,添加明确的重启设置,要求版本来源,或用确定目的的断言取代法官. 当公开方法发生变化时,更新矩阵. 不要把旧的未经记录的标签作为民间故事. 根据失败而选择,而不是根据排名表 首先,你在跑完之后要做出具体的决定. 如果您选择一个检索提供商,AMB的摄入/检索/生成/判断分离和时间数据直接有用. 运行相同的数据集,域名,生成模型,评判提示和模式. 它的README警告说,小提示或模型变化可以使精度变化两位数,因此没有这些版本针的比较无法复制. 如果您的风险是记住的信息可用,但不会改变后来的行为,请使用与行动结合的测试. 在后期会议中,早期的信息是必要的. 保存任务说明书和环境版本,然后检查不仅是最终任务分数不同的第一个操作. 如果决定内存是否不断改善状态工作流程, STATE Bench则提供更强的默认. 与相同的代理加内存进行没有内存的基线比较;保持pass@1,pass^5,cost和得分类型分开. 平均完成的增长与通过的下降^5并不是一个清洁的晋升. 根据LLM的判断,程序通过也不等于确定性数据库声明. 这些选项可以组合起来. 一个小团队可能运行AMB以消除过于不准确或昂贵的检索实现,然后运行一个集中行动关联的套件,然后用于重复工作流结果的 STATE Bench子集. 序列是可以辩护的,因为每个阶段都回答了一个名字的问题. 一个混合的排名榜号将隐藏一个候选人为什么通过. 这一限制很重要:本次审计将记录的方法进行比较;它并没有重复每一个基准指标,也没有声称没有无证的私人测试. 合成任务,模拟用户,评估模型,域覆盖范围和存储库修改都限制了结果将到您的工作量转移到多远. 添加操作检查基准留开 在线证据应该在晋升边界结束. 一个紧的活鱼应该从那里开始. 使用无内容识别器,当真实内存可能包含私有材料时. 例如,编写一个随机的鱼身份证,一个版本,一个预期的决定和过期时间. 保持原始提示,谈话,秘密和客户数据 然后运行这个链条: 1. A认出写. 记录内存名称空间,加拿大ID,预期版本,适配器版本和写收据. 一个成功的HTTP响应并不是证明所需的索引或持久存储所接受记录的证据. 2. 跨越一个真正的重启界限. 重启您实际上依赖的内存服务,代理运行时间或主机适配器. 在同一过程中开始新的聊天, 3. 阅读清新和原始. 要求预期版本和可检查的来源参考. 一个有意义可行的旧值是失败,而不是接近失败. 4. 输入冲突. 写一个新的值,保留旧标识符,并验证解决器返回预期的获胜者. 记录该政策是否是最后写的,明确的版本,源头优先级,或人类批准. 5. 要求采取后果行动. 给代理一个任务,在该任务中,正确的工具参数取决于鱼. 检查论点或状态过渡,而不是模型所产生的解释. 6. 验证目的地. 阅读表示完成的外部系统或文物. 命令退出,工具呼叫成功,和代理报告的成功是活动证据. 7. 在界限内重复. 运行足够的相等情况来显示不一致性,同时修复模型,提示,工具和环境版本. 追踪成本除了验证结果之外. 一个最小的收据可以看起来像这样: 如果未能找到所需的字段,请不要标记记记忆路径健康. 返回 uncertain ,保存最后一个已知证据时间, 安全响应不完整的证据不是自动重复试验,可能会重复外部影响. 你可以解释一个晋升规则 只有当三个陈述全部是正确时,才会促进记忆变化: 选择的基准指标直接执行导致变化的行为; 复制的结果在不违反达成的成本边界的情况下改善或保持质量; 现场鱼证明恢复持续性,正确的版本/来源,后续使用以及预期的目的地结果. 如果任何说法没有支持,请保留评估的变化. 这一规则是故意比"基准上"更严格的,但比建立一个普遍的评估平台更狭窄. 这给了一个小团队一个可审核的理由继续或停止. Sidewisp的产品方向将缺失记忆读写,重启过程中持续性失败,过时同步,重置,文本增长和丢失的决定作为健康信号. 产量监测引擎和运行时间适配器没有在当前的网站存储库中运送. Sidewisp 目前处于私密预览阶段。 如果证据模型与您操作代理的方式相匹配, 您可以加入私人预览等待列表,