2026-08-01T21:34:23.937Z

AI 剂可观察工具故障:五层测试

在选择维修之前,可重复的诊断区分了运输,协议,授权,执行和错误成功的结果故障.

一个AI代理即使其模型响应性,其过程活跃,工具调用也会出现. 因此, AI代理可观测性 的实际默认是测试一个工具调用在五个有序层:运输,协议,授权,执行和结果. 在第一个失败层停下来. 这一规则将一个模糊的"工具不可用"警报转化为有限的修复,并防止绿色响应包被误认为是交付的工作. 本指南适用于HTTP和JSON RPC的MCP式工具,但诊断形状也适用于自定义REST工具和本地命令适配器. 我们的目标不是收集每一个提示或有效载荷. 需要保留最小的证据来回答:电话停留在哪里,需要什么权威, 开始使用第一个失败层 一个单个 tool call failed 计数器失败,需要不兼容的响应. 一个DNS错误可能会证明有限制的连接再次尝试. 一个过期的代币可能会证明一个更新是合理的. 缺少范围需要一个人或管理员; 再次尝试同样的代币是浪费. 一个有效的工具响应,没有文件,门票,消息或数据库变化需要调查结果,而不是运输维修. 使用以下优先级: 层 最少证据 失败的例子 合理的下一步行动 交通 连接结果,HTTP状态,过去了时间 DNS 失败,拒绝连接, HTTP 503 检查可用性;仅在固定预算范围内重新尝试 议定书 要求ID,方法,JSON RPC错误代码 缺失 32601 方法, 32602 不有效参数 更新发现或修复请求合同 授权 HTTP 状态,清除的作者错误,所需范围 401 invalid token , 403 insufficient scope 一次更新或要求缺失的机构 执行 工具结果状况,截止时间,输出方案判决 MCP isError: true ,截止时间,结构性输出出现错误 检查工具的实现或输入 结果 目的地验证器和新鲜性 答案说创建,但艺术品没有. 检查目的地;不声明完成 秩序是重要的. 如果DNS解析失败,授权和结果是 unobserved ,不是失败. 发出五次失败的一次早休会增加事件数量, 保持协议故障与工具故障分开 在MCP工具调用中使用 tools/call ,而工具定义中包含 inputSchema ,并且可能包含 outputSchema . 目前的MCP工具规格也显示了 isError: false 的工具结果. 这些是不同的检查点:客户端可以访问服务器,交换有效的JSON RPC响应,但仍然收到工具级故障. JSON RPC明确了外部区别. 它的2.0规格保留了 32601 用于方法未找到和 32602 用于不有效参数;一个错误响应包含 error ,而一个成功响应包含 result . 一个JSON RPC result 只证明了协议交换完成. 它并不能证明工具接受了操作,其结构性输出与广告的方案相匹配,也不能证明外部副作用存在. 记录边界,没有存储敏感的参数: 这项事件故意省略了载体代币,工具参数,响应体,票文本和绝对路径. 在需要交叉运行结合时,使用 Hash 或地图识别符. 仅仅在健康记录仍然可以解释第一层失败和结果判决时,痕迹识别只有用. 不要再尝试一个权威问题,好像它是输掉包 授权应有自己的层次,因为 401 和 403 意味着不同的行动. 该经过MCP授权的规范要求客户处理 401 Unauthorized ,并通过 WWW Authenticate 描述保护资源的发现. 它还建议提供范围指导,以便客户了解目前请求所需的权威. 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 定义了 invalid token 为已过期,撤销,错形或以其他方式无效的载体代币,并将其与HTTP 401联系起来. 它定义了 insufficient scope 为缺乏所需特权的代币,并将其与HTTP 403联系起来. 这给运营商一个安全的决策规则: 1. 对于 invalid token ,一次尝试配置的更新路径. 如果更新的证书失败, 2. 对于 insufficient scope ,不要循环. 如果服务器提供了所需范围,请明确授权. 3. 永远不要把代币,更新代币,授权标题或原始挑战放在一般用途的远程测量中. 这种区别也防止了破坏性自动化模式:在工具调用失败时,扩大权限. 连接事件不能成为特权升级, 范围拒绝不能通过默默转换到更强大的证书来解决. 复制错误成功差距 配件包含八个合成调用:两个运输故障,一个JSON RPC方法错误,两个授权故障,一个工具执行错误,一个错误成功,一个验证交付. 从文物目录中运行分类器: 决定性结果是: 三次电话返回结果包,但只有一个结果得到了目的地验证. 一封封信上有执行错误;另一封封信宣称成功, 计数协议结果将报告37.5%的成功率. 经过验证的结果计数报告为12.5%. 区别不是检测器分数或LLM判断:它来自改变完成标准. 这种装置是故意决定性的. 实际系统增加了模糊性:一个门票API可以在返回ID之前提交记录和休息时间;一个目的地搜索可能是陈旧的;一个无效密钥可能允许安全的调整查询. 标记这些案例 uncertain . 在你知道第一次尝试是否发生之前,不要再试一下副作用的电话. 将证据转化为操作规则 每次试图操作工具的仪器1次健康事件,与拥有运行相关. 保存第一个失败层,清除代码,证据的新鲜性,重新尝试所有者, 然后使用四个控制器: 警报集团事件,而不是每一次尝试. 五次未能使用相同的过期证书的电话是一个权威事件. 按层进行重复试验. 运输故障可能会得到有限的后退;协议和范围故障通常需要合同或人力更改. 区分等待与着. 一个等待批准的OAuth流程的呼叫没有取得进展,但它不是执行循环. 仅在失败层经过 and 后清除事件,预期结果才能观察到. 一个成功的重试命令是活动,而不是恢复. 因此,有用的仪表板排行量很小:受影响的代理,第一个失败层,冲击,证据时间,可靠性,重试数量,所需权威和验证结果. 痕可能仍然是钻探. 这就是运营代理健康,而不是要求取代运行时间或通过新的网关运行每个模型请求. 我们还有一种严格的限制. 不是每个结果都有确定性验证器. 文件可以通过路径和消化检查;通过稳定身份证检查;通过健康终端点和修订进行部署. 研究很好可能需要一个类别或人类审查. 标签方法和信心,除了判决,而不是转化缺失证据为健康的证据. Sidewisp 目前处于私密预览阶段。 它的生产监测适配器和恢复执行通常不出货. 计划的方向是与现有运行时间相结合的健康层,在保持人类控制的同时,分开可达性,进展,工具访问和验证的结果. 如果操作模型与你的代理人相匹配,加入私人预览. 来源 模型文本协议:工具,规范版本2025 11 25 模型文本协议:授权,规范版本2025 11 25 JSON RPC 2.0 规格 RFC 6750, OAuth 2.0 持有符号使用