2026-08-01T14:17:36.886Z
AI 代理安全风险:建立操作威胁账本
在代理人跨越信任界限之前, 绘制凭证,权限,工具效果和重新尝试不确定性.
处理AI代理安全风险的实际方法是在工具调用前对每个副作用操作进行威胁模型. 记录哪些资产可以改变,哪些身份提供权威,哪些范围是要求的,该指令来自哪里,该效果将如何限制,以及哪些证据使重新尝试安全. 如果任何领域是未知的,请停在该边界,而不是要求模型推断许可. 这将产生有用的决定,而不是另一个风险列表. 运营商可以在重新尝试之前继续,缩小凭证,删除剩余许可证,审查不值得信赖的指示,定义效果限制或调整模糊的结果. 一个有效的工具反应不够:安全性取决于使用的权力和产生的外部影响. 不仅仅是模型 一个代理人不仅仅是LLM. 它将模型,运行时间,凭证,工具,外部内容和目的地系统结合成一个行动路径. AI代理纸的安全性明确了这一区别:代理使用模型生成的操作来调用可能影响实际系统的工具,从而创造了超越模型配合的机密性,完整性和可用性问题. 开始一个拟议的操作,并划出四个界限: 1. 指示界限: 用户意图,获取的内容,工具输出和内存进入模型文本. 2. A权限界限: 运行时间将身份或凭证添加到拟议的工具调用. 3. E 效果界限: 工具可以读取或更改外部资源. 4. Retry界限: 不确定的运输或工具结果可能会导致运行时间重复效果. 该欧亚太组织的代理安全倡议将其指导描述为针对新兴代理风险的基于威胁模型的参考指导. 在选择控制者之前,确定资产,参与者,信任变化以及可能的影响. 使用运行级别的威胁账本而不是自由形式的笔记: 不要把秘密价值放在本书里. 存储引用,发行商和观众识别器,过期期,范围,运营身份和证据位置. 艺术品应该回答"什么可能会改变,在谁的权威下,我们怎么知道? 合理的默认条件是每次外部操作创建一行账本. 一个一般的代理级威胁模型仍然有助于架构, 但它不能告诉你这个特定的付款,消息,发布或文件突变是否安全现在. 在检查提示之前,检查凭证身份 凭证不仅仅是因为它是认证证的. 每次操作,记录: 凭证代表谁或什么; 发行地点和可提交地点; 它是否在代理人或环境中共享; 它的过期和撤销路径; 资源的确切观众; 一个非机密的引用,允许操作员旋转它. 2025年6月的经过MCP授权的规范是关于HTTP边界的具体信息. 客户端包含一个资源指标,服务器验证一个代币是发送给预期受众,不有效或不够的授权收到错误. 相关的监管机构的安全指导禁止通过代币,并解释了为什么观众混乱会削弱控制,属性和信任边界. 这些规则直接适用于MCP HTTP授权. 运行原理也很好:永远不要让一个不透明的代币默默地代表每一个目的地. 没有任务所有者和狭窄的观众的共享管理员代币可能会完美工作,同时破坏属性并扩大爆炸半径. 证书健康和指令安全是分离的. 一个清洁的提示不能修复过期的代币,一个有效的代币不会使一个不值得信赖的指令合法化. 首先检查证据,因为每一次后续检查都取决于知道哪个身份将跨越工具的边界. 当缺少证据时,使用 stop credential ,而不是可能授权. 修复是机械的:为准确的代理,任务,观众和环境发出短暂的可撤销证书. 保持模型的决策. 需要的许可与授予的许可进行比较 只有当你对一个操作进行两个组进行比较时,最小特权才会被测试: 如果 surplus 不空,停止并取代补贴. 一个允许的工具不够. 同一个工具客户端可能携带与当前工作无关的范围,当文本中毒时,工具参数被取代时,或者模型简单地选择错误操作时,这些休眠权限就可用. 也拒绝缺失所需范围. 这种案例通常比超额权威更不危险,但它会产生响的重复试验,并鼓励不安全的解决方案,例如更广泛的凭证交换. 一个许可误差应该产生一个明确的状态和一个修复,而不是邀请代理寻找更强大的秘密. 许可证检查需要效果描述. 使用存储器工具太广泛; 在存储器中创建一个发布候选人 X提供资源和影响限度. 如果需要,将批准绑定到冷的描述. 人类审查对于具有高影响力或不值得信赖的运作是有价值的,但不应该要求一个人批准一个仍有未命名的资源或无限的影响的行动. 这就是威胁模型与防线实施的区别. 威胁账本确定需要保护的权威和影响. 政策,批准,沙盒和验证是随后选择的控制. 开始单独的控制通常让团队保护提示, 而一个强大的凭证保持不变. 处理指令,效果和重试作为分别的风险 外部内容可以影响一个代理人,而不会成为权威者. 标记指令来源为 trusted , untrusted external content 或 mixed . 如果不值得信赖的内容有助于产生副作用, 结拟议的资源和论点, 则需要在该内容路径之外进行政策决定或人为审查. 不要通过删除所有外部指令来解决这个问题. 代理可能需要检索文件或工具输出才能工作. 安全界限是,内容是否可以默默地选择特权效果. 仅阅读分析和公开消息发送不应具有相同的审查规则. 接下来,独立于工具响应定义效果: 准确的目的地资源; 变更的最大数量或规模; 逆转性和反弹性所有者; 稳定的运营身份; 权威反读或其他结果证据. 复试值得自己的行,因为时间过期并不意味着什么也没有发生. AWS 构建者 关于无能 API 的图书馆指导显示了稳定的客户端请求识别符如何使重复请求具有语义等效. 这份合同支持安全的默认重试. 它不授权原始操作,如果运行时间生成第二次尝试的新标识符,它也不会帮助. 在一个模糊的时间过后,使用以下顺序: 1. 保持原始操作身份; 2. 查询权威目的地; 3. 归类为现有,缺席,部分或未知的效应; 4. 只有在合同中确保另一次尝试安全时,再尝试; 5. 在最后一次尝试后,验证所承诺的结果. 如果目的地既不提供无效性,也不提供效果查询,则正确状态是 reconcile before retry . 这可能需要一个人. 这仍然比把缺失的运输证据转化为重复支付,消息,释放或删除更好. 再播放9次威胁账本 附带装置使得决定规则可检查. security risk cases.json 包含9项拟议的操作. evaluate ai agent threat ledger.mjs 以固定顺序检查边界: 1. 证书存在,过期,共享,可撤销和受众; 2. 要求范围与授予范围相比; 3. 书籍的不可信任指令来源; 4. 资源和最大效果的定义; 5. 在重新试验之前,操作身份,无力性和调整; 6. 独立的效果证据. 用: 复制的总结是: 只有两个案件. 一个是有限的阅读. 另一个是具有精确的观众,精确的范围,命名的资源,最大的影响力和独立的证据的无力写作. 其他案例显示共享管理员凭证,过期任务代币,过剩删除范围,未经审查的外部指示,无限出口,重新尝试新的操作身份,以及没有效果证明的成功反应. 秩序是重要的. 如果在认证受众之前检查许可证, cross service token可能会看起来安全,因为其范围恰恰匹配. 如果在重新试验前检查效果证据,运营商可以标记运行仅仅是不完整的,而另一个不安全的尝试已经有可能. 第一个不安全的信任界限应该决定这种态度. 适应设备与你的实际范围和效果. 添加缺失的撤销路径,错误的环境,过时批准,资源替代,部分写入,反弹失败以及工具输出和目的地状态之间的不一致. 我们的目标不是预测每一次袭击. 它是为了使权威和不确定性无法隐藏在一个绿色代理状态. 保持威胁模型的运行 当工具,范围,凭证发行商,目的地API,重试政策或指令源发生变化时,审查本书. 对于每次运行都不需要一个完整的研讨会; 从工具方案,身份元数据,政策和运营收据生成大多数领域,然后只询问一个人对代码无法解决的影响或不确定性. 紧密决策规则是: 只有在身份是受众的,权限等于所需的集合,不可信任的指令不能默默授权效果,影响是有限的,重试保存操作的身份,目的地可以证明结果. 这个规则有局限性. 转基因数据可能是谎言或过时. 一个确切的范围可能仍然允许一个危险的争论. 无能能力可能会过期. 一个回阅频道可能会与作者无关. 因此,本书减少了模糊性;它并不能证明整个系统是安全的. 结合下游授权,隔离,审计日志,测试和应对事件. Sidewisp 目前处于私密预览阶段。 它是针对现有代理运行时间的健康层,但生产代理健康收集和恢复并没有在当前网站存储库中运送. 这种威胁账本模式是运营商现在可以在自己的运行时间实现的,而不是Sidewisp目前保护或监控现场代理. 如果您正在评估Sidewisp,以便对未来的代理健康工作流程进行评估,请加入私人预览. 在此之前, 保持威胁账本接近工具边界, 让未知的证据阻止行动,