2026-08-02T01:06:35.599Z
测试AI代理:构建失效注射释放门
一个8个案例的释放门注入工具,重新尝试,内存,等待,截止日期和结果失败,并评级环境,而不是信任最终反应.
测试AI代理应该回答一个释放问题:当工具,许可,内存界限,批准或截止日期行为不好时,该代理是否保持安全性并仍然产生可验证的工作? 合理的默认是一个小的故障注射套件. 给每次试验一个可控制的错误,记录代理的转录,然后单独评分环境:工具访问,外部效果,连续性,等待所有权,截止日期状态和承诺的交付. 一个流的最后信息是有用的诊断证据, 这篇文章将该门构建成一个八个案例的Node.js装置. 一个案子安全完成. 一个人进入一个合法批准等待. 六应该阻止释放. 套件是故意小到可以在拉动请求中运行的, 并且明确到可以显示哪个合同失败. 当代理失败时,一个反应可以通过 传统的应用测试经常调用函数并确认其返回值. 使用工具的剂改变了测试的形状. 它可能需要多次轮流,选择工具,改变外部系统,为一个人暂停,在模糊的运输故障后再次尝试,并报告完成,而不留下预期结果. 人类的工程指南对代理评估分开一个任务,每个试验,它的评级,转录和最终结果. 其区别是实用的:转录可以说航班已预订,而环境预订数据库则说不一样. 在运行测试中,环境赢得了胜利. 这让我们检查三个不同的物体: Transcript证据: 代理人说什么,它要求哪些工具,以及每次电话回复了什么. E 效果证据: 下游系统中实际发生了什么变化,包括效果数量和无能性身份. O结果证据: 用户可见的交付物是否存在并满足确定性合同. 不要把它们分解成一个分数. 一个工具调用可以在效果发生后返回时间. 在文件缺席时,转录可以包含精细的摘要. 一个最后的文物可以存在两次,因为一次尝试使用了新的无能钥匙. 每个案例都需要不同的修复. 安全的测试环境也很重要. OWASPs 过度指导机构建议最低工具功能,最低下游权限,下游权限和人体批准高影响行动. 测试带应该遵循相同的边界. 使用设备,一次性命名空间,虚假支付或消息适配器以及无法接触真正客户的账户. 一个失败的测试永远不会成为它被用来预防的事件. 每次试验注射一个操作故障 开始一个快乐的路径,然后添加过 Agent 运营界限的失败. 最少有用的矩阵不是十个棘手的提示. 审判 注射情况 确定性预言 预期状态 健康的分娩 没有错误 一种效果和可验证的交付 PASS 合法批准 工具需要人的权威 拥有者,截止日期和恢复代币存在 EXPECTED WAIT 丢失的交付品 完成反应,没有结果 结果合同失败 FAIL OUTCOME 复制效果 再试创建动作两次 效果数量超过1 FAIL DUPLICATE EFFECT 许可损失 工具凭证缺乏所需范围 访问结果被拒绝 FAIL TOOL ACCESS 环境损失 重新启动将丢弃所需的决定 连续收件不匹配 FAIL MEMORY 无所有者等待 申请批准,但未获得批准 等待缺少所有者,截止日期,或恢复代币 FAIL UNROUTED WAIT 截止日期到期 在验证之前的时间预算结束 绝对截止日期已过去了 FAIL DEADLINE 合理的等待是积极的控制,而不是让步. 一个在高效行动之前停下来的代理人可能比一个在缺失权威的情况下即兴表演的人更健康. 预期只有在被调整后才能通过:一个命名的业主可以决定,一个截止日期可以防止沉默的放弃, 在每次试验中只注射一个主要错误. 如果您撤销一个凭证, 损坏了内存, 并立即到期, 套件可能正确阻止释放, 但教你很少. 单一错误试验保留了归因. 每个单独的合同工作后,再添加复合故障. 使用适配器,而不是提示指示注入故障. 假装数据库被拒绝访问测试角色扮演. 一个数据库适配器,返回与生产相同的拒绝形状,测试了控制路径. 同样,在记录虚假的外部效应后,注入运输时间,以复制危险的模糊性:即使呼叫者没有看到回应,请求可能成功. 结果预言必须是具体的任务. 对于编码剂,运行测试并检查存储器差异. 对于报告代理,需要文件,方案,引用的来源和目的地平数. 对于支持代理,请检查案例记录,而不是寻找最终答案的已解决. 通过确定性安全和完成检查后,添加一个校准模型评级器或人类对主观质量的审查. 运行八个案例的释放门 附带的文物包含 failure injection fixture.json , audit failure injection.mjs 和预期报告. 该分类器是故意的: 使用Node.js运行: 观察到的总结是: 查询号码是 responseOnlyFalsePassCount . 没有交付的试验说已经完成, 复制效果试验也说已经完成. 一个接受完成信息的评级者将通过两者. 环境状态门以不同的原因阻止它们. 检查是合同的一部分. 在一次试验中,工具拒绝是第一个失败的边界,而重复效果优先于验证的最终产品:两次生产正确的对象不是健康的完成. 预计工作的结果之前要进行预测,因为工作尚未完成. 你的申请可能需要另一个优先顺序,但写下来,明确检查模糊的案件. 这种装置也能使尝试与效果有所区分. effectAttempts: 2 如果一个稳定的无力钥匙离开 effectCount: 1 . 提供不安全的重试有 effectCount: 2 . 没有虚假的下游账本, 连接器可以计算通话, 对于道主义者来说, 一次干净的处决不够. 保持确定性状态预言,然后每个任务运行几个试验,并报告分布. 逆转套件应具有高预期通过率;一个难以实现的能力套件可以从较低开始. 永远不要隐藏在单个平均值内的差异, 允许其他地方强烈的散文分数取消严重影响或许可失败. 将分类转化为释放决定 紧的释放规则比权重的准备分数更容易辩护: 处理任何 FAIL 结果作为修复请求,而不是允许自动恢复带. FAIL TOOL ACCESS :确定测试凭证或代理被拒绝访问路径;不要扩大生产许可仅仅是为了使测试绿色. FAIL DUPLICATE EFFECT 在重试中保持一个逻辑操作的身份,并在另一次尝试之前验证效果. FAIL MEMORY :定义必须生存重启的最低决策收据,然后测试实际的持久性界限. FAIL UNROUTED WAIT :添加所有者,截止日期,决定收据和可重新开始的工作身份. FAIL DEADLINE :扩散一个绝对的截止日期和保留取消,清理和结果验证的时间. FAIL OUTCOME :修复可交付的路径或其预言器;编辑完成文本不会解决故障. 保持边界清晰. 这套八个案例并不证明一般可靠性. 它只涵盖你注射的错误和你编码的断言. 它不会发现未知的供应商行为,判断研究报告是否有洞察力, 主观任务仍然需要进行校准审查,生产系统仍然需要监测实际可用性,进展,等待,工具的访问,结果和成本. 每次生产事件都会变成一个被消毒的回归试验. 保存输入形状,注射最小的因果条件,删除秘密和客户数据,并添加最强的可用结果预言. 随着时间的推移, 释放套件变成了代理不再被允许重复的失败记录. Sidewisp 目前处于私密预览阶段。 现场体验是早期访问的网站和互动示范;生产代理健康收集,运行时间适配器和自动恢复通常不出货. 测试模式是团队今天可以在自己的带中实现的. 它还显示未来健康层应该遵守的明确证据界限:活动不是进步,信息不是结果,命令不是恢复,直到预期结果得到验证.