2026-08-01T20:42:51.127Z
检查后的代理:在五步中证明恢复
一个可复制的恢复梯度,将完成的干预和现场心跳与有用的进展,得到验证的结果和持久的稳定性分开.
一个AI代理不仅仅是因为重启,重试或推进成功返回. 实际情况下, Zagent监测 的默认标准是通过五步验证恢复:记录授权干预,确认可访问性和准备性,观察具体任务的进展,独立验证所承诺的结果,并观察一次稳定窗口出现复发. 在最强的检查通过之前,保持状态为 recovering , uncertain ,或 needs human 不健康. 这种区别很重要,因为维修命令和用户的工作在不同的层面上. 一个程序可以在其凭证仍然过期期间重新启动. 在代理重复相同的工具呼叫时,心跳可以恢复. 一个代理人可以宣布完成,而文件,门票,消息或部署仍然没有. 恢复是证据的要求,而不是活动事件. 通过验证梯子清除事件 用一个梯子而不是一个绿色状态. 每一步都会回答不同的问题,并且应该保持自己的时间,来源和信心. 步骤 问题 最少证据 报道如果失败 干预 确切的限制行动是否被授权并执行? 批准参考,行动类型,试验ID,退出或API结果 needs human 或 intervention failed 可达性 运行时间可联系并准备好完成任务吗? 新鲜的心跳加上任务相关的准备检查 unreachable 或 alive only 进步 自干预以来,有用的工作发生了什么变化? 单调的文物,完成的单元,线索器,测试三角形或目的地变化 alive only 或 recovering 结果 预言的结果是否存在,并满足其确定性检查? 目的地本地搜索,消化,测试,修改或收件 false recovery , recovering 或是 uncertain 稳定性 诊断的失败没有持续足够长时间才能重复吗? 一个工作负载特定的观察窗口,没有重复症状 relapsed 或 recovered 合理的默认性是保守的:可达但没有移动有用工作的代理是 alive only ;恢复可测量工作但未达到结果的代理是 recovering ;只有新鲜的结果证据在稳定窗口中存活,才能获得 recovered . 库伯尼特斯使用相关的分离器. 它的探测器文件给了启动,活力和准备不同的工作:活力可以触发重新启动,而准备控制容器是否应该接收流量. 它还警告说,错误的活力探测器可能导致断故障. 类似性有界限代理任务不是Pod,但操作课程转移: 过程应该重新启动和工作已经完成不应该是相同的测试. 一个稳定窗口不是一个任意的5分钟睡眠. 选择最短的时间间隔, 对于每两次工具调用重复的循环,请观察至少两次清洁的工具调用机会. 如果有预定的出版商,等到其下一个结果截止日期. 如果认证失败,请一次使用非破坏性检查使用受影响的许可证. 窗口应该足够长,以伪造修理,但不长以至于事件在存在决定性证据后保持模糊. 记录一个恢复尝试,而不是一个松散的命令序列 联系诊断,权威,干预和验证与一个不可改变的试验身份. 否则,监视器可以从手动重新启动到早期自动推动的心跳, 一个隐私限制的活动可以看起来像这样: 这次事件不需要提示,答案,秘密,原始工具的有效载荷,或绝对的路径. 它确实需要行动界限和证据界限. 保存 action completed 作为收据,而不是作为恢复判决. 这项规则对于非同步API尤其重要. 标准 9110节 15.3.3表示,HTTP 202 Accepted 响应意味着处理尚未完成,可能永远不会发生;响应应该描述当前状态并指向状态监测器. 如果代理的恢复适配器接收 202 ,则跟踪该监视器或查询目的地. 不要把"接受"转化为"固定". 痕迹具有相同的范围边界. OpenTelemetry将跨度定义为一个工作单位,其状态是其追踪操作的状态. 一个清洁的 restart agent 跨度证明操作没有报告错误. 它不确定是否制订了报告,收到的门票,或部署服务于预期的修订. 与后来的进展和结果证据联系干预时间;不要过度加载其状态. 权威也属于记录. 如果重新启动,认证更新,发送消息或反弹需要批准,并且没有有效的批准,监视器应发射 needs human . 它不能尝试行动,然后要求回顾许可. 恢复还需要重新尝试和时间预算. 在第一次失败之后,第二次干预是新的决定,而不是原始命令的无形延长. 复制心跳假阳性 附带装置包含八种合成后干预案例:缺失权力,行动错误,只有心跳活动,恢复进展,已验证的稳定恢复,复发,已过时的验证证证据,以及代理宣布完成,但缺失的目的地结果. 从文物目录中运行分类器: 决定性结果是: 简单的规则行动完成,心跳现有报告了六次恢复. 楼梯报告一个. 这不是因为楼梯悲观. 一个案例是真正的 recovering :有用的进展恢复,结果仍在待定. 另一个有新的结果证据,但然后重复诊断失败,所以它是 relapsed . 根据两分钟的新鲜度合同,它是 uncertain 没有失败,也没有健康. 设备的 120 第二新鲜度门是说明性的,而不是生产默认的. 证据的新鲜性属于验证者. 在本地存储的文件可能会立即决定. 一个最终一致的搜索索引可能需要记录的延迟. 如果验证器本身无法使用,则保存 uncertain 并暴露缺失信号. 不要重新启动机器,仅仅是为了使仪表板变得绿色. 谷歌的监测分布式系统章区分症状与原因,黑盒与白盒的证据. 它还将错误内容的成功协议响应视为一个错误,可能需要端到端测试. 在此恢复阶段,干预收据和运行时间远程测量是白盒原因证据;目的地本地结果检查是黑盒症状测试. 这两种方法都是有用的,但只有后者才能解决用户实际丢失的问题. 转换回收验证为运营合同 对于每个监控任务类别,在事件发生之前定义梯子: 失败说明允许限制干预; 允许批准每项行动的人或政策; 逆转性行动及其努力,时间和成本限制; 行动后的运行时间准备检查; 一个有预期方向的有用进步领域; 确定性结果验证器,其最后期限和新鲜度限制; 复发机会将稳定窗口关闭; 试图失败时的反弹或升级路径. 让判决词汇保持小. " Needs human "意味着缺失权威,秘密或不可逆决. " Intervention failed "意味着已批准的行动未完成. Alive only 意味着运行时间已经准备好,但没有有用的进展. Recovering 表示进展已恢复,而结果或稳定检查仍然开放. Uncertain 意味着缺失或过时的决定性证据. " False recovery "是没有承诺的结果过去了结果截止日期. Relapsed 意味着原始症状返回. Recovered 意味着任务特定结果已得到验证,并且复发窗口保持清洁. 有诚实的限制. 一些结果不能通过确定性来检查. 客户接受了分析可能需要人为决定; 总结是好的可能需要一个标题,其可靠性本身是测量的. 目的地也可以在响应时间结束之前产生副作用. 在重新尝试之前,请与无能关键或独立搜索进行调整. 当证据无法解决状态时, Sidewisp 目前处于私密预览阶段。 它的生产监测适配器,代币成本分析和恢复执行通常不出货. 预期的方向是与现有运行时间相结合的健康层,使诊断,权威,证据的新鲜性,有用的进展和结果验证明确. 它不应成为强制模型门户或自主固定器. 如果那个操作模型适合你的代理人,加入私人预览. 来源 库伯内特斯:活力,准备和初始探测 谷歌SRE书:监测分布式系统 RFC 9110:HTTP语义, 202 已被接受 开放电气:痕迹