2026-08-02T00:38:23.887Z

AI代理可观察性:衡量有用的进展,而不是仅仅是活动

一个与运行时间中立的五信号框架, 告诉生产商工作的合法等待, 摊位,无法达到的运行时间,

AI 代理可观测性是从外部证据中解释代理所做的事情的能力:痕迹,日志,指标,工具事件,模型调用,延迟,代币和成本. 这种证据是必要的,但它不是健康判决. 在请求文件丢失时,可以完成追踪. 在代理人重复相同的步骤时,工具调用可以成功. 一个安静的跑步可以正确地等待获得批准. 实际答案是保留远程测量,并增加一个小的决策层. 对于每个任务,一起观察五件事:可达性,有用进步的三角形,声明的依赖性,确定性结果检查,和成本在同一窗口. 在提醒或恢复任何东西之前, 这本指南将这个规则变成一个可执行的五个案例. 它是故意的运行时间中立的:同样的推理可以坐落在OpenTelemetry跨度,Claude Code事件,OpenClaw运行日志或定制代理以上. 一个痕迹证明了什么是跑的,而不是什么是改变的 目前的对GenAI代理范围的OpenTelemetry语义公约定义了创建和调用代理,调用工作流程,规划和执行工具的操作. 文件标记为 Development ,这在设计长期的方案时很重要:使用适用的惯例,但在自己的正常化层后隔离版本敏感的属性. 运行时间遥测已经变得详细了. 克劳德代码的监控文件描述了指标,事件和beta分布式痕迹. 它的跟踪树可以包括交互,模型请求,工具调用,用户决定的时间被阻止,以及工具执行. 记录的字段包括持续时间,代币,估计成本,工具结果大小和 success . 这些领域回答了有价值的问题: 运行时间回应吗? 哪个模型和工具运行? 有没有特定的工具回复了错误? 准许等待和执行需要多长时间? 运行消耗了多少代币和美元? 它们并不能定义你的任务的成功. 返回出口代码0的 shell 命令证明该命令是在自己的合同下完成的. 它不证明一个文章是公开的,网站地图包含其URL,抽取请求通过CI,或客户记录到达预期系统. 应用程序可以添加这些检查,但一个通用工具成功领域不能发明它们. 因此,活动和进步可以朝着相反的方向发展. 没有输出三角形的十九个成功工具调用可能是循环. 两次工具调用,然后是沉默,可能是一个健康的等待. 如果未完成,最后一个信息可能是错误的成功. 从五个信号中构建一个健康窗口 在查看结果之前,请选择特定任务的观察窗口. 五分钟可能适合一个小代码编辑;一个小时可能是合理的计划的研究工作. 避免一个全球性的门, 在那个窗口里,收集五个信号: 信号 最少的证据 它所阻止的 可达性 心跳年龄,过程/会议响应,或调度器运行收据 处理无法达到的运行时间作为一个推理失败 有益的进步 单调,具体任务的三角形 误认为重复活动是运动 依赖性 输入等待原因,所有者,及到期时间 合法需要人或外部系统的工作重新尝试 结果 预言结果的确定性预言 接受完成消息,没有交付值 费用 在同一个窗口里,使用代币,电话,时间或钱 忽略昂贵的重试,没有进展 有用的进步必须是具体的. 对于编码器,可能是测试结果发生变化,新的承诺,或测试失败数量减少不输送到终端的线. 对于出版商来说,可能是CMS草案ID,然后是公共API匹配,然后是网站地图中的现场URL. 对于支持代理人来说,这可能是一个验证的门票过渡,而不是另一种模型反应. 当一个存在时,更喜欢确定性结果的预言: 只有不能机械检查结果时使用评估器,并存储其标题,版本和不确定性. 不要把隐藏的思想链作为一个快捷途径. 工具的选择,明确的计划,输出,时间标签和状态变化提供了操作证据,而不需要私人推理. 费用属于窗口,但仅仅是费用,并不是健康. 预计有10美元的资金能使移民得到验证. 没有改变的搜索中花费的50美分可能是异常. 有效的衍生措施是: max 避免零分;它不会使零进步健康. 如果 progress delta == 0 和成本持续上升时,请单独警告. 分类工作,等待,着,无法达到和虚假的成功 决策是重要的. 首先检查可访问性. 然后尊重一个明确的依赖, 在接受之前,请检查所谓的完成与结果预测. 只有这样才能解释进步和过去的时间. 这里有一个完整的NDJSON装置. 保存为 health window fixture.ndjson : 使用 Node.js 运行这个分类器: 预期产量: 固件使得论文可伪造. 一个简单的规则,如 tool calls 0 ,标志着 run stuck 和 run false success 作为活跃. 仅基于沉默的规则标志着 run waiting 不健康. 五信号规则将它们分开,因为它保留了依赖性和结果证据. 举个例子,是一个决策骨架,而不是一个普遍的得分模型. 在信号不同时,生产代码还需要新鲜性,信心,源头身份和 uncertain 路径. 映射每个状态到一个有限的响应 排名是为了防止错误的行动,而不是为了装饰仪表板. 国家 需要证据 默认响应 工作 近期可及性和积极进展 放下它;稍后再样品. 在等待 类型的依赖性,所有者,未到期的到期时间 一次通知负责人;不要再尝试阻塞的步骤 住了. 没有依赖,没有进步的三角形 检查重复步骤;在限度范围内准备一次可逆的重试或推 错误的成功 完成声明,确定性结果失败 重新打开任务并报告缺失的预言;不要称其为完整 无法达到 停滞的心跳或失败的运行时间接触 在改变提示之前检查主机/运行时间的可用性 不确定性 缺失或矛盾的证据 收集缺席信号或请求;不要自动恢复 在AI系统之外,这种分离具有有用的先例. 库伯尼特斯区分了启动,活力和准备性探测器 因为"过程存在"和"服务应接收流量"是不同的决定. 它的文档还警告说,设计不良的活力探测器可能会在不必要的重启中导致断. 这种比喻有一个界限:一个AI代理不是一个Pod,有用的进步取决于任务. 可转移的课程更窄,不要让一个模糊的绿色或红色信号授权每次干预. 为了积极恢复,将以下限制添加到该行动上: 一次复试,而不是无限复试循环; 最长的时间和成本; 一个可逆的步骤; 对破坏性或外部行动的明确批准界限; 行动后的进展或结果检查. 完成命令不是恢复. 在预期状态变化后才清除事件. 合同的工具,而不是每一个想法 一个紧的正常健康记录可以坐落在你现有的痕迹数据旁边: 保持证据引用的访问控制和编辑秘密,提示,原始工具有效载荷和绝对本地路径,除非严格要求. 医疗记录应该说明检查的情况以及授权运营商可以检查的情况;它不应该成为敏感远程测量的第二份副本. 版本四个东西明确: 1. 正常化证据的运行时间适配器; 2. 进展的定义; 3. 结果预言; 4. 分类器规则和门. 没有这些版本, 改变测试命令或更名的交付可能看起来像突然的代理回归. 知道该方法在哪里停止 最难的是,不要再收拾一张. 它是诚实地定义有用的进展和承诺的结果. 有些任务没有单调的进步量度. 一个研究代理可能会抛弃一个弱假设,回到一个早期的阶段;即使一个计数器跌倒,这可能是有价值的工作. 一些依赖性不显示可靠的到期时间. 有些结果需要判断而不是检查. 在这些情况下,保存证据并报告 uncertain . 不要用普遍的健康评分来制造精度. 此外,将在线健康检查与离线评估分开. 在线数据集可以揭示一个新的代理版本在已知情况下是否更准确. 现场健康窗口回答了一个不同的问题:这个特定的跑步是可达的,移动的,合法等待的, 你通常需要两者. 开始一个后果的工作流程. 定义一个进步三角形和一个确定性结果预测. 再播放已知的工作,等待,困住,无法达到, 只有分类符合现实后,警报或有限恢复行动应依赖它们. Sidewisp 目前处于私密预览阶段。 它的公共网站和文章系统是现场的,但生产代理 健康收集,运行时间适配器和恢复通常不出货. 产品方向是一个健康层,使证据,新鲜度,信心和批准界限更容易采取行动,而不需要取代代理运行时间. 主要引用 2026年7月24日获取的开放Telemetry:genAI代理和框架范围的语义公约 ;文件状态:开发. 克劳德代码:监测 官方的远程测量领域和配置,截至2026年7月24日. 库伯内特斯:活力,准备和初始探测 官方调查目的和恢复警告,提到了2026年7月24日.