2026-07-31T12:16:48.837Z
多智能体人工智能系统的交互式调试和指导:每次重置都门控
将多代理倒带和编辑转变为可审核的分支,具有检查点覆盖、效果协调、批准和新结果收据。
多代理人工智能系统的交互式调试和引导不应被视为转录编辑。安全重置会创建一个具有自己的谱系、恢复状态证据、权限记录和结果收据的新分支。如果浏览器、工作区、队列、凭据或外部目标无法恢复或协调,则正确的状态是不确定的,而不是“就绪”。 这是我们应该吸取的实际教训多智能体人工智能系统的交互式调试和指导,背后的CHI 2025论文Microsoft的开源AGDebugger。该研究使得倒带和编辑可用于多代理调试。操作部署还需要一个边界:重置可能会重新创建足够接近的内部状态来测试假设,但它无法自动撤消电子邮件、恢复票证、取消发布页面或证明新分支完成了用户的任务。 合理的默认值是带有六个门的转向收据: 1. 母公司和分公司具有不同的身份; 2. 检查点涵盖每个必需的代理和工具状态密钥; 3. 检查点后的影响被恢复或协调; 4. 操作员有权进行干预; 5. 代理配置已固定到新分支; 6. 恢复的分支机构将获得新的结果收据。 只有前五个分支才能 准备恢复 。第六个使其 验证 。 重置是分支,而不是倒回 这AGDebugger论文从一个具体问题开始。五位代理开发人员描述了在长时间对话中定位错误的困难、缺少交互式调试控制以及代理配置迭代缓慢的问题。作者构建了一个系统,允许开发人员逐步浏览消息、重置到较早的点、编辑先前的消息并比较生成的对话分支。一项由 14 名参与者参与的两部分研究随后检查了诊断和指导策略。 这是比搜索日志更强的交互。开发人员可以在故障边界提出两个可证伪的问题:如果相同的状态再次运行会发生什么,如果特定消息发生变化会发生什么?该论文报告了其研究中三种常见的指导形式:添加细节、简化任务和更改计划。 但实施细节比编辑功能更重要。AGDebugger在处理消息之前检查代理状态。重置时,它会恢复相应的检查点并创建一个新会话。分叉前的消息和检查点保持共享;新消息和检查点属于该分支。这就是血统,即使界面看起来像是倒带。 将操作视为分支为运算符提供了三个有用的不变量: 原始失败的运行仍然可以检查; 确切的分叉点是不可变的; 编辑和以后的每个效果都属于一个新会话。 如果没有这些不变量,经过编辑的文字记录可能会重写用于诊断事件的证据。由此产生的“成功运行”可能无法重现,因为没有人知道它是由哪个历史记录、提示、工具架构或模型配置产生的。 分支记录不需要消息内容: 哈希标识符和粗略编辑类足以进行证据追踪。不要仅仅为了证明分叉存在而导出提示、工具参数、机密或用户数据。 在更改计划之前恢复州保险范围 从记录中删除消息并不是状态恢复。论文称AGDebugger代理实现状态保存和加载方法。 Web 代理的状态可以包括 URL 和视口位置;其他代理可能需要不同的状态。它还将检查点策略描述为“足够好”,因为完全恢复浏览器 JavaScript 和远程应用程序状态可能不切实际或不可能。 该限制应该放在重置按钮旁边,而不是事后分析。 在运行开始之前定义工作流所需的状态键。对于小型研究和出版团队来说,他们可能是: 该检查点不完整,因为缺少批准队列。重放记录可能会导致分支机构再次询问、跳过现有决定,或者表现得好像权力被延续。操作员应该看到 restore uncertain ,不是绿色恢复控件。 覆盖是必要的,但还不够。对于每个状态密钥,记录修订或无内容指纹以及恢复结果: 状态密钥 重置前的证据 所需的恢复测试 代理记忆 修订和检查点哈希 加载的版本与前叉匹配 浏览器 来源、路由哈希和本地会话类别 预期路由可达且会话类别有效 工作空间 存储库提交和脏状态摘要 精确的修订加上有意的局部更改 工具注册表 模式哈希和功能计数 当前注册表匹配或偏差已被确认 审批队列 决策收据 ID 和状态 保留未决和已解决的决定 自检查点以来,实时远程系统可能已移动。这并不总是失败。这是给证据贴标签的一个原因。如果浏览器可以返回到记录的页面,但该页面的基础记录已更改,则快照保真度是部分的。操作员仍然可以运行诊断分支,但不得将其呈现为精确重放。 配置是状态的一部分。固定分支使用的代理角色、模型标识符、工具集、系统提示和路由规则。否则,成功的编辑只能证明某些未知的组合有效。保持原始配置不可变并记录有意的增量。 在重放工具调用之前协调效果 检查点在调试器的控制下恢复状态。它不会扭转外部世界。 假设父分支在检查点之后创建了票证,然后未能生成承诺的公开报告。在工具调用和重放之前重置可以创建第二个票证。没有回应并不能证明第一次呼叫没有效果。在恢复之前,枚举每个具有外部效果的检查点后操作并对其进行分类: reverted :原始效果已安全撤消; reconciled :效果保持不变,新分支将重用或跳过它; pending :目的地证据缺失; irreversible :效果无法撤销,需要新的人类决定。 任何事物 pending 或者 irreversible 阻止该边界处的自动重播。 在目的地支持的情况下使用稳定的操作键。对于发布操作,请在创建另一个目标之前通过不可变的草稿 ID 查询目标。对于电子邮件,请保留提供商消息 ID,而不保留消息正文。对于存储库更改,请比较预期的提交或树哈希。对于票证,通过请求的幂等键检索票证。 经营者的干预也需要一个权限边界。当分支仅限于本地固定装置时,编辑计划的风险较低。当编辑更改收件人、预算、权限、生产目标或破坏性操作时,情况会大不相同。将这些编辑路由给授权所有者并将分支保留在 needs approval 直到决定收据到达。 等待那个决定并不被困住。在权限或目标状态未知的情况下重复恢复就是失败。 针对不方便的情况运行转向收据 附带的工件是一个无内容的固定装置和确定性分类器。它不运行AGDebugger或声称复制其用户研究。它测试围绕重置的操作决策。 本地运行: 该夹具包含八个分支。分类器产生: 该测试添加了第九个断言:ID 等于其父级的分支被拒绝为 invalid lineage . 优先顺序是经过深思熟虑的。缺少状态块会影响解释,因为操作员无法建立分支的起点。未协调的影响会在考虑批准之前阻止恢复。批准和固定配置使分支准备就绪,但不健康。恢复后,预期的交付成果仍然需要确定性验证者。 改变一个字段,结果应该会发生可预测的变化。将缺少的批准队列密钥添加到部分恢复中,它可以前进。将待处理的票证效果标记为已协调,并且分支可以到达权限门。放 outcomeVerified 在流畅的最终答案后变为 false,结果保持不变 false success . 这产生了一个重要的操作区别: “准备恢复”意味着干预边界得到控制。 “已核实”是指新分支机构完成了预定工作。 请勿将这些州合并为一个绿色徽章。 实验没有证明什么 该工件验证决策规则,而不是快照保真度。它无法证明浏览器已完全恢复,LLM 将采取相同的路径,或者未记录的副作用从未发生。真正的集成需要特定于运行时的状态适配器和目标查询。 这AGDebugger研究也有一个有限的范围:5 名形成性受访者、14 名研究参与者、两项研究任务和一个基于AutoGen。其发现证明了交互模式的合理性;他们并没有为每个多代理架构降低事件发生率。该论文本身确定了开放的挑战,包括将转向与代理实现解耦以及确定编辑是否有效。 这些限制强化了操作规则。使用交互式重置来隔离假设,而不是制造确定性。保留父级,显式分叉,恢复可以证明的内容,标记不能证明的内容,协调外部影响,要求权威,并在目的地验证新结果。 Sidewisp 目前处于私密预览阶段。其生产监控适配器和恢复执行器通常不发货。这里的方法是一种可检查的操作模式,而不是声称Sidewisp已经检查站或引导现场代理团队。Sidewisp的产品方向将人类权威、证据和结果验证作为安全恢复的核心。 如果您现在运行多代理系统,请从一种容易出现故障的工作流程开始。在下一个事件之前定义其状态键和外部影响账本。第一个有用的检查点并不是能够重播最多历史的检查点;它可以准确地解释什么被恢复了,什么还没有改变,谁授权了这个分支,以及最终结果是如何验证的。