2026-08-01T21:34:38.237Z

AI可观察性:构建四层信号合同

运行信号覆盖的审计, 区分时间表,执行,依赖性和验证结果证据,

AI可观测性不是仪表板类别. 它是能够用证据回答四个不同的问题的能力: 究竟是什么? 这是否等待一个合法依赖? 有没有预期的结果存在并通过验证? 只有回答第二个问题的堆可以产生美丽的痕迹,而计划的代理人从来没有开始,人类的批准没有被注意到,或者一个成功的运行没有留下可交付的结果. 因此,实际默认是四层信号合同: 时间表,执行,依赖性和结果 . 保持模型延迟,代币,错误,工具调用和跨度,但不要把它们当成整个合同. 这篇文章测试了一个小的NDJSON装置的规则,并为您提供一个可以适应的审计, 处理AI可观察性作为覆盖问题 搜索AI可观测性结果混合了几个合理的担忧:模型质量,数据漂移,GPU和应用性能,代理痕迹,安全性,治理性和成本. 这种宽度是为什么我们有可观察性难以评估的. 两个团队可以在收集不同证据时使用相同的短语. 对于执行计划或委托工作的代理人,使用预期的工作作为分析单位. 然后要求每一个问题一个层,可以改变行动判决. 层 最少证据 失败可能会暴露 时间表 预期时间,截止日期,开始时间,时间表身份 跑步从来没有开始 执行 运行 ID,步骤或跨度,工具结果,终端状态,错误类 运行停滞,循环,重新尝试或失败 依赖性 显而易见的等待状态,依赖性类型,批准或外部系统参考 合法的等待被错误地标记为被困 结果 产品或副作用的身份,确定性检查,验证时间 执行说成功,但工作是缺席或错误的. 这些层不是四个供应商产品. 他们四个结合一个稳定运行身份证. 一个后端可能包含大多数执行事件. 一个安排者可能知道预期的时间. 批准系统可能拥有等待证据. 目的地本身物体存储,存储库,门票API,数据库通常拥有最强的结果检查. 这种框架也使监测和评估保持分开,而不会将它们分开. 如果没有确定性检查,基于分类的质量分数可以成为结果验证器. 当其中一个文件可用时,它不应默默地取代文件哈希,测试结果,行数或API收件. 为什么一个完整的痕迹仍然可以错过事件 追踪标准正在迅速提高. 在 74fd2e0 的承诺中,开放Telemetry生成 AI语义公约的覆盖模式和代理范围,指标,事件,例外,供应商特定公约和MCP. 该文件标记了GenAI公约为 Development ,这是设计长寿方案时重要的版本界限. 代理跨度规范定义了 create agent , invoke agent , invoke workflow , plan 和 execute tool 等操作. 它还具有有用的属性,包括 gen ai.operation.name , gen ai.agent.name 并且有条件要求 error.type 看到的 代理范围来源. 这是强有力的处决证据. 它告诉调查员发生了什么操作, 跨度是如何相关的, 它们花了多长时间, 框架追踪可能更丰富. 该开放AI代理SDK追踪文件表示其默认的追踪涵盖了运行员的调用,任务和转换时间,代理,代代,功能工具,护和交付. 它还支持定制跨度和处理器. 这使得我们能够将缺失的商业证据添加起来. 但既没有完成的跨度,也没有终端 ok 证实原本预计有计划的运行. 它也不证明 weekly report.pdf 存在,具有新的报告期,并通过了分析仪. 缺席并不是追踪的缺陷. 它是执行远程测量和运营结果证据之间的边界. 这一边界是可以伪造的: 执行两个相同的成功执行事件, 添加一个 outcome verified 事件, 如果当前的警报显示了两个运行相同的绿色状态,它不能检测错误的成功. 在固定装置上进行四层审计 附带装置包含在 2026 07 25T02:42:00Z 上观察到的四个运行: run alpha 启动,调用报告工具,完成和记录验证的文物; run beta 具有相同的成功执行形状,但没有得到验证的结果; run gamma 明确等待批准 approve 42 ; run delta 没有开始活动,超过预期的最后期限. 运行 Node.js 20 或更新版本的审计: 分类器返回每个状态中的一个运行: 代码使用了故意无聊的决策命令. 一个验证的结果赢了. 一个明确的等待,既有理由,又有批准的参考, 在最后期限之前从来没有开始的运行被错过了. 没有证据证明结果的完毕运行是虚假的成功. 一个开始运行过了最后期限是卡住的. 其他一切都在工作,而不是被提升为健康. 这是一个实验,而不是基准. 四个手工案例无法估计生产错误率,而真正的分类器需要重复事件处理,时钟偏差宽容,迟到的结果和每个工作的截止日期. 这种方法是有用的,因为每一个判决都是可检查的,改变一个事件改变一个结果. 保持等待作为自己的状态 一个健康/不健康的二进制场在操作员需要信息时破坏信息. 考虑 run gamma :进程没有进展,但重新启动将是错误的默认. 它有明确的批准依赖. 正确的行动是向正确的人提出请求,同时保留其范围,年龄和权限. 存储至少: 使用相同的方法来设置率限制重置时间,外部工作身份证,维护窗口和上游数据到来. 一个免费文本信息,如"仍在等待"是很弱的证据:很难路由,过期或相关. 一个输入依赖加上一个不透明的引用支持一个有限的响应,而不需要将秘密,提示或批准内容复制到远程测量中. 活动同样容易过度估值. 复制的工具调用表明一个过程繁忙;只有状态或结果的分数显示有用的进展. 因此,重试计数器属于最后一个有意义的变化时间,而不是一个通用的最后事件时间标签,一个循环可以永远更新. 让结果检查目的地本地 最强的验证者住在工作应该落地的地方. 在文件中,记录一个稳定的对象键,大小,消化和解析结果. 对于拉取请求,记录存储库,公关号码,目标分支和所需检查结论. 对于CRM更新,记录非机密实体ID,预期的字段过渡和读后写结果. 不要把原料放在每一个痕迹上. 存储需要重复检查的最小证据. 开放AI代理SDK文档警告说,生成和函数跨度可能包含敏感的输入和输出,并描述了禁用该捕获的控制. 应用同样的原则到您的定制活动:识别器和消化器通常比提示,响应,凭证,绝对的本地路径或客户内容更安全. 结果验证也需要新鲜性. 昨天的运行没有证据证明今天的运行成功. 通过运行ID,预期报告期,创建窗口或当前开始时间后计算的消化来将文物加入当前运行. 现在有个交易. 目的地本地检查增加了集成工作,并且可以独立失败. 处理不可用的验证器为 unknown ,不健康,也不会自动失败. 检查失踪证据,最后一次成功检查, 在比较特征之前对合同进行审计工具 有用的产品评价从四行开始,而不是标志格. 对于每个候选人堆,请问每个层的起源,它如何加入运行,保持多久,以及哪个查询证明覆盖性. 1. 它能否进口或导出预期时间,包括时间区和截止日期? 2. 它能追踪模型,工具,转移,重试和错误事件而不需要敏感的有效载荷捕获? 3. 它能代表一个类型的依赖和升级目标的等待吗? 4. 它能吸收或链接到目的地的决定性结果收据吗? 5. 它能否区分没有证据的结果与健康的结果? 6. 如果工具发生变化,您可以通过开放格式或API导出数据吗? 不要拒绝专注的追踪工具,因为它缺乏时间表或结果语义. 如果关节是可靠的,请将其与缺失的来源相结合. 拒绝架构,如果它不能代表你需要的区别,隐藏缺失数据在绿色状态下,或者需要原始敏感内容进行例行健康检查. 四层合同解决了原始问题:AI对运营特工的可观察性只有在能够单独解释预期,执行,依赖和验证结果时才是完整的. 痕迹是基本的证据,但它们只是一个层. Sidewisp 目前处于私密预览阶段。 它的目的是与现有的运行时间相结合,具有证据和人权的界限;目前生产监测和恢复适配器通常不出货. 如果这个信号合同与你需要捕获的故障相匹配,