2026-08-01T14:17:44.448Z
AI 代理护卫轨:构建四控制行动门
在信任代理工具的呼叫之前, 单独的政策,准确的批准,执行界限和效果验证.
AI代理护不应具有一个提示符,一个分类符或一个批准按. 对于可以改变外部状态的代理人来说,实际的默认是四个控制的行动门:决定是否允许行动,证明调用者有权威执行这个准确的行动,绑定尝试,然后验证外部效果. 每个控制器都会回答不同的问题. 合并它们成一个 safe: true 旗, 隐藏一个代理是否被封锁,等待一个人, 如果把这些状态分开,系统就会失败,而不需要把每次停顿视为事件. 将政策放在行动边界 首先要缩小代理人要求工具做的事情. 一个政策门户应收到结构化行动数据,而不是单纯的散文: 政策结果应该是 allow , deny 或 unknown 的结果. Unknown 这很重要. 缺失分类并不意味着许可,强制对 allow 或 deny 的模糊性使得模型代表运营商创造确定性. 此门还必须检查该工具是否属于代理的能力集. 关于过度代理的OWASP指导 标识过度的功能,权限和自主性作为独立的根本原因. 其减轻措施相应是具体的:只暴露必要的扩展,偏好狭窄功能而不是开放式命令,给予最低下游权限,并执行下游系统中的授权. 这最后一个边界是重要的. 一个说明如"永远不要删除生产数据"是有用的文本,但它不是授权控制. 删除终端点应该拒绝未经授权的身份,即使代理人提出有说服力的理由. 同样,只能阅读的工作流不应该接收一个可以写证的客户端. 模型护仍然有工作,但知道它们的时间. 开放AI代理SDK文档区分了代理输入/输出防护和功能工具防护. 它还指出,经纪人已经消耗代币或执行工具后,并行输入保护可以完成. 在执行前立即使用阻塞检查,以实行下游授权. 合理的缺陷是: 拒绝在每剂许可名单之外的工具; 从结构化行动中计算所需范围; 执行这些范围在模型之外; 如果政策输入是不完整的,则返回 unknown ; 记录政策版本和行动摘要. 内容过器不能取代此门. AWS 连接AI护文件涵盖被拒绝的主题,内容过器,地面检查,词过器和敏感信息控制,同时记录配置限制和延迟权衡. 这些是输入和输出的有用保障措施. 它们没有证明发行,支付,消息或文件突变是授权的. 结合批准的行为,而不是谈话 批准太模糊了,无法执行. 安全审批是与审查人员的确切行动相关的短期权威信封. 最少要坚持: 在执行前立即重新计算动作消化. 如果资源,论点,演员,工具,影响或过期不同,则批准不匹配. 问一遍,而不是把旧决定延伸到新工作上. 这可以防止一个安静但严重的失败类别. 一个人可能会批准一个存储库的释放候选人,然后代理的文本改变,重新尝试重建不同的参数,或者另一个运行重复使用相同的对话状态. 一个自由漂浮的布鲁尔式存活了三个错误. 一个被限制的收据没有. 批准还需要一个拥有者和可重置状态. awaiting approval 不是 stuck :它有一个命名的决定,一个路线到正确的人,和一个期限. 在决定后,从结的行动包中恢复,而不是重新进行计划,希望模型提出相同的操作. 不是每一个行动都需要一个人. 使用影响来决定: 只有阅读的,可逆的,范围较小的行动可以在常规政策下进行; 有限制,经过检验的反弹的变化可能使用明确的限制和审计; 公共,金融,破坏性,特权变更或其他具有高影响性的行动需要准确的批准; 关于对一个人的撞击路线的模糊性. 因此,人类审查是堆内部的一个控制,而不是堆本身. 在授权后也会被限制执行 允许和批准的行动仍然可能会很糟糕. 执行者需要严格的限制, 代理人不能默默重新谈判: 一个绝对的截止日期,在每次尝试之前检查; 试图的最大数量; 对于副作用的无效性关键; 一个资源和影响上限; 取消路径; 一个关于结果模糊时发生的事情的规则. 在重试中,操作身份必须保持稳定. 如果目的地发生变更后出现运输截止时间,则发出新的运营身份可能会复制效果. 如果目的地支持无权,请重复使用相同的钥匙. 如果它提供了权威的搜索,在重新尝试之前,请调整. 如果没有,请停止使用 unverified ,而不是猜测另一次尝试是安全的. 保持执行器状态机械. 一个模型可以建议重新尝试,但代码应该决定 attempt < maxAttempts ,最后期限是新鲜的,资源仍然匹配,并且该操作具有可使用的免费密钥. 这是一个罕见的地方,无聊的条件是正确的设计. 限制不仅仅是为了防止损害. 他们保留了诊断. 没有它们,重复的电话可能看起来像持续,过期的操作可能看起来像缓慢的进展, 操作员可以使用明确的界限区分工作,等待,阻塞和不确定状态. 独立检查效果 工具响应证明了工具所报告的信息,而不是用户所需要的. 最后的门将可观测的后条件与所承诺的结果进行比较. 偏好确定性证据: 通过稳定的ID来获取创建的对象; 阅读目的地分支或释放记录; 验证预期文件是否存在及其哈希匹配; 执行相关的测试; 确认预期目的地出现消息; 将精确资源的前后值进行比较. 不要两次使用相同的弱信号. 如果写端点返回 { "ok": true } ,将该字段复制到完成记录中并不是独立验证. 读取来自权威的目的地或检查承诺的交货物. 一些结果不能立即验证. 通知可能被接受,但无法交付,外部提供商可能缺乏读取API,或者观察频道可能过时. 表示作为 unverified ,包括缺失证据和下一次安全检查,避免报告成功. 这就是运营健康和安全的相遇. 政策和授权防止禁止行动; 效果验证防止错误完成. 一个特工可以遵守每一个访问规则, 另一方面,成功的结果并不能为未经授权的道路辩护. 在信任设计之前,再播放9个案例 随之而来的器件将四个控制器转化为一个小型的可执行测试. guardrail cases.json 包含9项拟议的行动. evaluate agent guardrails.mjs 适用于固定优先级: 1. 政策; 2. 范围和批准权威; 3. 执行限制; 4. 效果证据. 用: 复制的总结是: 那些有趣的案例不是清晰的通过或明显的否认. 一个批准已经过期. 另一个指纹被发行为不同的行动. 一篇文章耗尽了重试预算. 一个命令没有观察到的效果. 一个政策根本不能分类行动. 这些案例表明,国家优先事项必须明确. 首先检查效果证据,未经授权的行动可能被标记为未经验证的. 在政策之前检查批准,你可能会要求一个人授权一个工具, 失败未知到拒绝,运营商失去了可修复的数据质量信号; 失败到允许,系统发明权威. 适应自己的工具. 添加资源替代,范围损失,重新使用的批准不良,过时的政策版本,截止日期过期,部分影响,反弹故障以及与工具反应不同意的验证道的情况. 只有当这些失败产生你预期的状态和下一步行动时,门才准备好. 让边界保持诚实 随着AI代理的防护护,当每个控制者因其原因而否决该行动并揭露该决定的证据时,它们就会有效. 紧的规则是: 政策决定该行动是否适合. 权威是谁能做什么. 限制限制了尝试. 验证证明了效果. 这比添加分类器更贵. 准确的批准增加了等待时间. 阅读后写检查增加了电话. 狭窄的工具需要工程. 不知名国家需要操作员的处理. 这种交易对副作用有好处,因为模糊性仍然是可见的,而不是成为沉默的权威或虚假的成功. Sidewisp 目前处于私密预览阶段。 它是针对现有代理运行时间的健康层,但生产代理健康收集和恢复并没有在当前网站存储库中运送. 这里的控制堆是一个可以现在测试的实施模式,而不是Sidewisp目前执行的要求. 如果您正在评估Sidewisp,以便对未来的代理健康工作流程进行评估,请加入私人预览. 在此期间,保持动作包裹及其证据在自己的运行时间:最安全的护是当模型自信地错误时仍然保持的护.