2026-08-01T14:17:45.365Z

AI エージェントガードレイル: 4 制御アクションゲートを構築する

エージェントのツールの呼び出しを信頼する前に 政策を別にして 正確な承認 実行制限 効果検証

AI エージェントのガードレーンは,1つのプロンプト,1つの分類器,または1つの承認ボタンを搭載してはならない. 外部状態を変更できるエージェントにとって,実用的なデフォルトは4つの制御のアクションゲートです:アクションが許可されているかどうかを決定し,呼び出し者がこの正確なアクションの権限を持っていることを証明し,試みを拘束し,外部効果を確認します. 各コントロールは違う質問に答えます safe: true の旗に組み合わせると 代理人が ブロックされているか 人を待ってるか 予算が足りないか 道具の呼び出しの後 証拠が欠けているか 隠すのです これらの状態を別々に保つと システムは 停滞を 事故として扱わずに 閉ざされて失敗する可能性があります 政策を行動の境界線に まず 道具に依頼できるものを 減らして始めましょう 政策ゲートには,プロースのみではなく,構造化された行動データを受け取るべきです. 政策結果は, allow , deny ,または unknown のいずれかであるべきである. Unknown は重要だ 欠落した分類は許可ではなく, allow または deny に曖昧さを強制することで,モデルの操作者のために確実性を発明します. このゲートはまた,道具がエージェントの能力セットに属するかどうかを確認しなければならない. 過剰な代理に関するOWASPガイドラインは,過剰な機能,許可,自律性を別々の根本原因として識別する. その緩和はそれに応じて具体的です:必要な拡張のみを暴露し,オープンエンドコマンドよりも狭い機能を好む,最小のダウンストリーム許可を与え,ダウンストリームシステムで許可を強制する. この最後の境界線は重要だ 生産データを削除しないように指示は,有用な文脈ですが,許可制御ではありません. 削除エンドポイントは,代理人が説得力のある理由を提示しても,未承認のアイデンティティを拒絶すべきです. 同様に,読み込みのみのワークフローは クライアントが クレジットカードを書き込むことができるような クライアントを受け取るべきではありません. モデルガードレーンは まだ仕事があるが タイミングを把握する OpenAI エージェント SDKドキュメントは,エージェント入力/出力ガードレーを機能ツールガードレーから区別する. また,同行入力ガードレーンは,エージェントがすでにトークンを消費したり,ツールを実行した後で終了することが確認されています. 副作用の境界線については,実行前にすぐに ブロックチェックを使用し,実際の下流許可でサポートします. 合理的なデフォルトは: 代理人別許可リストの外の道具を拒否する. 構造化された行動から必要な範囲を計算する. モデル以外の範囲を強制する. unknown を返します. 政策のバージョンと行動記号を決定とともに記録する. コンテンツフィルターはこのゲートを置き換えない. AWSのConnect AIガードレールドキュメントは否定されたトピック,コンテンツフィルター,アースティングチェック,ワードフィルター,そして敏感な情報制御をカバーし,構成制限と遅延のトレードオフを文書化する. 輸入と輸出の有用な保護手段です 公開,支払い,メッセージ,またはファイル変異が許可されていることを証明するものではありません. 一つの行動に 承認を結びつけるのではなく 承認は実行できないほど曖昧です 安全な承認は,審査を受けた人によって正確に実行された行為に結びついている短期的な権限の封筒です. 少なくとも,続けなさい. 実行前に行動の消化を再度計算する. 資源,議論,演員,ツール,影響,または期限が異なる場合,承認は一致しない. 新しい仕事に対して古い決断を延ばすのではなく,もう一度尋ねてください. これは静かなが深刻な失敗を防ぐものです 1つのリポジトリのリリース候補を承認したり,エージェントの文脈が変化したり,別の議論を再構築したり,同じ会話状態を再利用したりする可能性があります. 3つの誤りすべてに生き残ります. 行動決済領収書にはない 承認には 持ち主と再開可能な状態も必要です awaiting approval は stuck ではありません. 名前は決定され,適切な人に通る路線があり,期限が切れます. 決定後,計画を再開し,モデルが同じ操作を提案することを期待する代わりに,凍結された行動封筒から再開します. すべての行動には人間が必要ではありません 影響で決定する 読み込みのみ,逆転可能で,範囲が低い行動が,常時政策の下で実施することができる. 制限された,よくテストされたロールバックによる変更は,明示的な制限と監査を用いることができる. 公的,財政的,破壊的,特権変更,またはその他の影響の高い行動には正確な承認が必要です. 人への衝突路線に関する曖昧さ したがって,ヒトのレビューは,スタック内の制御であり,スタック自身ではありません. 許可後でも強制執行 承認された行動は 失敗する可能性があります 執行者は 代理人が黙って再交渉できない 厳しい制限を必要とします 一つの絶対的な期限,すべての試みの前に確認される. 最大の試行数 副作用に対する無効性キー 資源及び影響上限 キャンセル経路 結果が曖昧であるときに 何が起こるのかという規則です 操作のアイデンティティは,再試中でも安定した状態でなければならない. 目的地が変更をした後に輸送時間停止が発生した場合,新しい運用身分を発行すると効果が倍増する可能性があります. 目的地が idempotency をサポートしている場合,同じ鍵を再利用する. 信頼性の高い検索結果が出たら 再試する前に 調理してください. もし2つとも存在しないなら unverified をやめなさい 実行機を機械状態に置いてください. モデルが再試を推奨できるが,コードは attempt < maxAttempts ,締め切りが新しく,リソースはまだ一致し,アクションには使用可能な無効性キーがあるかどうかを決定する必要があります. 退屈なコンディショナルは 正しく設計されている 珍しい場所の一つです 制限は 損害を抑えるためだけに限らない 診断を保ちます 繰り返される呼び出しは 持続性 終了した操作は 遅い進歩と 複製された効果は 回復のように見えます 操作者は明示的な境界線で,作業,待機,ブロック,不確実な状態を区別することができます. 効果を独立で確認する ツールの反応は ツールの報告を証明するもので,必ずしもユーザが必要としているものではない. 最終的なゲートは 観測可能な後条件と約束された結果を比較します 決定的な証拠を好む: 作成されたオブジェクトを安定IDで取得する. 目的地分岐またはリリース記録を読み取る. 期待されるファイルが存在し,そのハッシュが一致していることを確認する. 関連試験を実施する. メッセージが意図された目的地に表示されていることを確認する. 正確な資源の前値と後値を比較する. 同じ弱信号を2回使用しないでください. 書き込みエンドポイントが { "ok": true } を返信した場合,そのフィールドを完了記録にコピーすることは独立した検証ではありません. 信頼できる目的地から読むか 約束された納品品をチェックする いくつかの結果はすぐに確認できない. 通知が受け入れられても届かない場合,外部プロバイダに読み取り APIが欠けている場合,または観測チャネルが時代遅れである場合がある. unverified として,欠けている証拠と次の安全チェックを記載し,成功を報告することを避ける. ここには安全と安全が集まる場所です 政策と承認は禁止された行動を防ぐ. 効果検証は誤った完了を防ぐ. 捜査官はあらゆるアクセスルールを 遵守しても 任務に失敗する その反対に 成功した結果は 許されない道を許さない. デザインを信頼する前に9つのケースを再現する 4つのコントロールを 小さな実行可能なテストにします guardrail cases.json には9つの提案された措置が含まれています. evaluate agent guardrails.mjs は,一定の優先順位が適用されます. 1. 政策 2. 範囲と承認機関 3. 実行制限 4. 効果の証拠 実行する: 複製された概要は: 興味深いケースは 純粋なパスや 明らかな否定ではありません 1つの承認が終了しました 別の行動指紋が発行されました 一つの手紙で 予算が枯渇した 一つの命令は観察効果がないまま実行されました 一つの政策では 行動を全く分類することはできません. これらのケースは,なぜ国家優先順位が明示的になければならないかを示しています. 検査効果の証拠を最初に確認し 許可のない行動は 単に検証されていないと標識されることがあります ポリシーの前に承認を確認すると 絶対に利用できないツールに 許可を求めることができます 無知に崩壊して否定され,オペレーターは修復可能なデータ品質信号を失い,それを許容に崩壊させ,システムが権威を発明する. 装置を自分の道具に合わせる 資源の置き換え,範囲の喪失,再利用の承認の不適用,古いポリシーバージョン,期限切れ,部分的な効果,ロールバック失敗,およびツール応答に同意しない検証チャネルのケースを追加します. その失敗が 意図した状態と 次の行動を 生み出す時だけ ゲートが準備ができている. 境界線を正直に 守れ AI 代理のガードレーンは,各コントロールが,その理由から,その行動に拒否権を与え,その決定に対する証拠を暴露できる場合に動作する. コンパクトルとは 政策は 行動が適当かどうか決める. 権威は誰が何をすべきか決める. 制限は 試みを制約します 検査で効果が証明されました これは分類器を追加するよりも費用がかかる. 正確な承認は 待機時間を増やします 読み書き後チェックは 呼び出しを追加します 狭い道具には技術が必要です 未知の州には 操作者が必要だ 商売は副作用に価値があり 曖昧さは沈黙する権威や偽りの成功ではなく 明らかになります Sidewisp は現在プライベートプレビュー段階です。 既存のエージェントの実行時間周辺の健康層として意図されていますが,生産エージェントの健康収集と回復は現在のウェブサイトリポジトリに送信されません. Sidewispが現在それを実行しているという主張ではなく 現在テストできる実装パターンです Sidewispを将来のエージェント・ヘルスケアワークフローに評価している場合は,プライベートプレビューに参加してください. その間 行動封筒とその証拠を 実行時に保管してください. モデルが間違いだと確信しているときに 保持できる 保護線は 最も安全です.