2026-08-01T14:17:38.097Z

AI エージェントセキュリティリスク:運用脅威レジャーを作成する

信頼の境界を越える前に 信頼の境界を越える前に 信頼の証明書,許可,ツール効果,不確実性を再試します

AI代理のセキュリティリスクに対処する実用的な方法は,ツール呼び出し前に各副作用操作を脅威モデル化することです. どの資産が変更できるか,どのアイデンティティが権限を提供するか,どの範囲が要求されているか,指示がどこから来たのか,効果がどのように制限されるか,また再試行を安全にする証拠を記録する. モデルから許可を推測するように要求する代わりに,その境界線で停止します. これは有用な決定ではなく 別のリスクリストを生み出します オペレーターは,再試する前に,進捗,認証を絞り,余剰許可を取り除き,信頼されていない指示をレビューし,効果制限を定義し,曖昧な結果を調和させることができます. 有効なツール対応だけでは不十分です セキュリティは使用された権限と生成された外部効果に依存します 脅威モデル 操作だけでなく モデル エージェントは LLM以上のものです モデル,実行時間,認証情報,ツール,外部コンテンツ,目的地システムを一つのアクションパスに統合します AI エージェント紙の安全性はこの区別を明示的にします:エージェントはモデル生成のアクションを使用して,実際のシステムに影響を与えるツールを呼び出すため,モデルのアライナメントを超えて機密性,整体性,および利用可能性に関する懸念を生み出します. 1つの提案された作戦から始め 4つの境界線を図る 1. 指示境界: ユーザー意図,取得されたコンテンツ,ツール輸出,メモリがモデル文脈に入ります. 2. A権限制限: 実行時間は,提案されたツール呼び出しにアイデンティティまたは認証を添付します. 3. E 効果境界: ツールが外部リソースを読み取ったり変更したりできます. 4. Retry boundary: 不確実な輸送結果やツール結果は,実行時間の効果を繰り返す可能性があります. OWASP 代理セキュリティイニシアチブは,その指針を新興代理リスクに関する脅威モデルに基づく参照として記述している. コントロールを選択する前に 資産,アクター,信頼の変化,潜在的な影響を特定します フリーフォームのメモではなく,実行レベルの脅威レジーを使用します. 秘密の価値観を本に書き込まないでください. ストア参照,発行者および視聴者識別子,有効期限,範囲,運用身分,証拠の位置. 文書は 証明書漏洩が起きずに 答えなければならない 合理的なデフォルトは,外部操作ごとに1行本を作成することです. 一般的なエージェントレベルの脅威モデルは まだ建築に役立ちますが この特定の支払い,メッセージ,リリース,またはファイル変異が 今では安全かどうかを教えてくれないのです プロンプトをチェックする前に認証証明書の身分を確認する 認証証明書は 認証だけで安全ではありません 各操作については,記号: 資格証明書は誰を代表するか 発行された場所と提示できる場所 代理人や環境間で共有されているかどうか 期限切れと撤回経路 資源の正確な視聴者 操作者がそれを回転させる非秘密の参照. 2025年6月 MCP許可の仕様はHTTPの境界について具体的に述べています. クライアントはリソース指標を入力し,サーバーは,意図された視聴者向けにトークンが発行されたことを確認し,無効または不十分な権限がエラーを受け取ります. 関連 MCPのセキュリティガイドラインはトークンパスで禁止し,なぜ観客の混乱がコントロール,属性,信頼の境界を弱めるかを説明します. これらの規則は,MCP HTTP 許可に対して直接適用されます. 操作原理もよくあります 透明性の低いトークンが 目的地ごとに 黙って立たないようにしないでください タスクの所有者や狭いオーディエンスのない共有管理者トークンは,属性を破壊し,爆発半径を拡大しながら完璧に動作する可能性があります. 資格の健康と指示の安全は別です クリーン・プロンプトは 期限切れのトークンを修復することはできません 有効なトークンは 信頼されていない指示を正当化するものではありません まず 証明書をチェックします 後に確認されるものは どのアイデンティティが ツールの境界を越えるか 知り次第です 証拠が欠けている場合, stop credential を使用してください. 修理は機械的なものです. 特定のエージェント,タスク,オーディエンス,環境のための短期間のリvocable 認証証明書を発行します. その決断に モデルを巻き込まないでください 必要な許可と与えられた許可を比較する 最小特権は,一つの操作で2つのセットを比較するとのみテスト可能になります. surplus が空いていない場合は,補助金を停止して置き換えます. 許可されたツールだけでは不十分です 同じツール クライアントは現在の仕事とは関係のない スコープを搭載し,その休眠許可は,文脈が汚染され,ツール引数が置き換えられたり,モデルが単に間違った操作を選択したときに利用可能になります. また欠けている必要範囲を拒絶する. このケースは通常,余分な権限よりも危険性が低いが,騒々しい再試しを作り出し,より広範な認証を交換するなどの安全でない解決方法を奨励します. 許可の不一致は 明確な状態と修復を 生み出すべきで 代理人が より強力な秘密を 探すよう誘われるのではなく 許可チェックには効果の説明が必要です リポジトリツールを使用するはあまりにも広い. リポジトリで1つのリリース候補を作成する Xはリソースとインパクトシークルを提供します. 承認を,必要に応じて,その凍結された記述に結びつける. 人によるレビューは,高影響または信頼性の低い事業において価値あるものであるが,まだ無名の資源または無制限の効果がある行動の承認を要求すべきではない. これは脅威モデルが 防護カーネルの実装と 異なる点です 脅威レジーは保護を必要とする権限と効果を特定する. 政策,承認,サンドボックス,および検証は,その後選択された制御です. コントロールのみから始めると チームがプロンプトを保護する一方 圧倒的な認証は変わらず残ります 指示,効果,再試を別々のリスクとして扱う 外部コンテンツは 権威にならずに 代理人に影響を与えるのです trusted , untrusted external content ,または mixed として指示 provenance をマークする. 信頼できないコンテンツが副作用をもたらす行動に寄与すると,提案されたリソースと議論を凍結し,そのコンテンツ経路の外で政策決定または人間のレビューを必要とする. 外部の指示をすべて削除してこれを解決しないでください. エージェントは取得した文書やツール出力を作業するために必要とする可能性があります. セキュリティの境界線は そのコンテンツが 黙って特権的な効果を選択できるかどうかです 閲覧のみの分析と公開のメッセージ送信は同じ審査規則を共有すべきではない. 次に,ツール応答から独立して効果を定義する. 正確な目的地資源 変更の最大数値または規模 リバーシビリティとロールバック所有者 安定した運用アイデンティティ 権威ある反復読み取りまたは他の結果証明. タイムアウトとは,何も起こらなかったことを意味しないため,リトリーが独自の行に値する. AWS 構築者 無力なAPIに関する図書館ガイドは,安定したクライアントリクエスト識別子は,繰り返しリクエストを意味的に等しくする方法を示す. その契約は 安全なデフォルトの再試をサポートします 実行時間は,第2回試用のための新しい識別子を生成した場合,元のアクションを許可するものではありません. 曖昧なタイムアウトの後,次の順序で使用します. 1. 元の操作アイデンティティを維持する. 2. 権限のある目的地について問い合わせる. 3. 効果を現在,不在,部分,または未知として分類する. 4. 契約により,次の試みが安全である場合にのみ再試す. 5. 最終試み後,約束された結果を確認する. 目的地が無効性や効果検索を提供しない場合,正しい状態は reconcile before retry です. その人が必要になるかもしれません 欠けている交通証拠を 複製された支払い,メッセージ,リリース,または削除に変えるよりずっと良いのです 9件の脅威レジューを再現する 配備装置は,決定規則を検査可能なものとする. security risk cases.json には9つの提案された操作が含まれています. evaluate ai agent threat ledger.mjs は,境界線を固定順にチェックします. 1. クレデントリーの存在,期限切れ,共有,撤回可能,そして視聴者 2. 必要な範囲は,与えられた範囲と対照的に, 3. 書き込みの不可信な指示源; 4. 資源と最大効果の定義 5. 操作のアイデンティティ,無効性,再試される前に和解 6. 独立した効果証拠 実行する: 複製された概要は: 2件しか続かない 1つ目は 制限された読書です もう"つは正確なオーディエンス,正確な範囲セット,命名されたリソース,最大限の影響,そして独立した証拠を持つ無力な書き方です 残りのケースでは,共有された管理者認証書,期限切れのタスクトークン,余剰削除範囲,未審査の外部指示,無制限の輸出,新しい操作アイデンティティを再試し,効果証明のない成功応答が示されています. 秩序は大事だ クロスサービス・トークンは,許可が認証オーディションの前に確認された場合,その範囲が一致しているため,安全に見える可能性があります. 効果証拠が再試される前に確認された場合,オペレーターは,もう1回の不安全な試みは既に可能である間に,実行を単に不完全であると標識することができる. 信頼の境界線が 判断すべきです 装置を実際の範囲と効果に合わせて調整します 欠落した撤回経路,誤った環境,時代遅れの承認,リソースの置き換え,部分書き込み,ロールバック失敗,ツール出力と目的地状態の間の不一致を追加します. 目標は全ての攻撃を予測することではありません 権能と不確実性を 緑のエージェントの地位の中に 隠すことは不可能にするのです 脅威モデルを有効に保つ ツール,範囲,認証発行者,目的地 API,リトライポリシー,または指示源が変更されたとき,レジャーを見直す. 実行ごとに完全なワークショップを必要としません. ツール・スキーム,アイデンティティ メタデータ,ポリシー,操作領収書からほとんどのフィールドを生成し,コードが解決できない影響や不確実性についてのみ尋ねます. コンパクト決定規則は: アイデンティティがオーディエンティに限定され,許可が要求されるセットに等しく,信頼されていない指示が効果を黙って許可できないときのみ実行します 影響が制限され,再試は操作のアイデンティティを維持し,目的地は結果を証明できます. この規則には限界がある. メタデータは嘘になるか 時代遅れになるかもしれません 確固たる範囲は 危険な議論を許すかもしれない. 失能症は終了する可能性があります. 読み返しのチャネルは 書き方と妥協されるかもしれない. 本書は曖昧さを軽減し,システム全体が安全であることを証明するものではありません. ダウンストリーム認証,隔離,監査記録,テスト,インシデント対応を 効果に適したものと組み合わせる. Sidewisp は現在プライベートプレビュー段階です。 既存のエージェントの実行時間周辺の健康層として意図されていますが,生産エージェントの健康収集と回復は現在のウェブサイトリポジトリに送信されません. この脅威レジーのパターンは 運用者が現在 実行時に実装できるもので Sidewispが 現場で代理人を保護したり監視したりしているという主張ではありません Sidewispを将来のエージェント・ヘルスケアワークフローに評価している場合は,プライベートプレビューに参加してください. それまでは 脅威簿を ツールの境界に近づけ そして 未知の証拠が 事件になる前に 行動を止めさせてください