2026-08-01T11:10:51.445Z
AIエージェントの科学への信頼性:証拠の監査
検査可能な証拠プロフィールに紙の12のメトリックを変換し 配備決定に必要な健康診断を追加します
AIエージェントの信頼性 の科学への の短い運用読み方は次のとおりです:紙の4次元プロフィールを維持し,それを生み出した証拠なしに12つのスコアを並べないことを決して受け入れません. 部署決定については,現時点での可用性証明,期待される実行,所有される待機,ツール効果,目的地結果の証明も追加する. 基準プロフィールと健康判断の直観的な回答は 関連が異なる質問です ステファン・ラバンサーと同僚の2026年6月 arXiv v3紙は,原作作業の精度に関係なく信頼性を測定します. GAIA で 15 つのモデルと τ ベンチ の 清掃されたサブセットを評価し,信頼性を一貫性,強固性,予測可能性,安全性 に分解します. 研究されたリリースウィンドウの能力向上は自動的に比較可能な信頼性の向上をもたらさなかった. これはオペレーターにとって有用だが,各メトリックを証拠契約に変換した後だ. 下のチェックリストは,その翻訳を行い,残りの生産境界線を明示しています. 12つのメトリックを証拠要求として読み取ります 紙の表2には12のメトリックが含まれています. 12つの交換可能な品質ポイントではありません 寸法 紙メトリック 保存すべき最低証拠 一貫性 結果,軌道の分布,軌道の順序,資源利用 タスクセットバージョン,独立ランカウント,結果オラクル,アクションシーケンス,リソースユニット,および各ラン記録 頑丈性 欠陥 環境 迅速 ベースライン試験,ペア perturbed 試験,バージョンの perturbation 仕様,および環境または迅速な変更がタスクの意味を保持した証拠 予測可能性 校准;差別/AUROC;Brier 格付け前の信頼性,バイナリー結果証拠,ビンリングまたはランキング方法,サンプル数値,信頼性の源 安全性 合致性,損害の重度 バージョンの制限,あらゆる違反,厳格な規則,判事の身分とバージョン,および人による検証サンプル a メトリックは,その名詞,プロトコル,および証拠位置なしに利用できない,低くない,健康的な ではない. 結果の一貫性について考えてみましょう 40つのタスクを5回繰り返しても 200のテストが得られますが スコアだけでは 同じタスクが成功と失敗の間に交代するか 固定されたサブセットが毎回失敗するか分かりません これらのパターンは,平均的な精度が似ているし,非常に異なる操作結果をもたらす可能性があります. 試験レベルの証拠を捨てると 解決する問題を再現します 頑丈さ指標は さらに注意が必要です 誤った注射スコアは,ベースラインに対してのみ解釈できます. 迅速性強度スコアは,変異が意味的に等しい場合にのみ有効である. JSONフィールドの改名により,環境脆弱性がテストされる. 課題を解決するために必要な情報を削除すると,課題が変更されます. perturbation generator,そのバージョン,そしてレビューされたサンプルを 結果の隣に保存します. 予測可能性は同様に厳格なタイムスタンプが必要です 評価結果が上がる前に 自信を得て 検査結果を見た後書かれた自信は予測ではない. また,その値がエージェントから,別々のモデルから,カリバー化された分類器から,またはヘューリスティックから来たかどうか記入する. 校正,AUROC,Brierのスコアは 誤った信頼信号から正しく計算できます 最後に,紙の安全境界を保持してください. 公的方法論は,安全性を総合的な信頼性スコアから別々に報告する. 操作のデフォルトです 堅調な一貫性スコアは 許可のない破壊的な行動を平均してはならない. 遵守基準は,制限がどのくらい頻繁に遵守されたかを測る. 条件による損害の重さは,違反がどれほど深刻であったかを問います. 周波数と尾も必要だ 論議する前はプロフィールを整え 証拠パケットが不完全である場合,限界論点は早すぎる. まず構造をチェックする小さなプロフィールリナーを作りました 12つのメトリックがすべて存在します. 各メトリックにはスコア,番号,指数,プロトコル,および証拠 URIがあります. 耐久性結果は,ペアベースラインと乱射数値とバージョンの仕様を含みます. 予測可能性の結果は信頼源を特定する. 安全性結果は,制約と判断方法を特定する. 安全性は,全体的な信頼性積分に折りたたまれていない. 自動部署には,人間で検証された無効な安全サンプルが含まれます. その後は6つの生体健康の証拠をチェックします フレッシュさ,アクセシビリティ,スケジュールカバー,待機所有者,ツール効果領収書,目的地結果領収書. 含有したイラストレーティングプロフィールには12つの紙メトリックと30例のヒト安全レビューが含まれています. 結果は: 2つのブロッカーには ツール効果と 目的地結果の領収書が欠けている. Linterテストは,これらの2つの証拠参照を提供し,結果を PASS に変更します. 偽物のエージェントが安全であることを証明するものではなく 証拠の証明は 検証するのに十分な 完全であることを証明します 違いが重要だ 監査を実行する: これは故意に 軽量な器具です 存在と形状を検証する 科学的正当性ではなく 基準値がユーザを表しているのか,信頼報告書が正直なのか,二つの提示が同じことを意味するのか, LLMの判事が損害を正しく評価したのか,判断することはできません. これらのことは,ドメインレビューの課題であり続ける. プロフィールを1つのリリース番号に変換しないでください 紙は比較を支えるために次元集計を計算するが,その選択は,なぜ事業者がプロフィールを目に見えるようにしなければならないかを明らかにする. 全体的な信頼性積分は一貫性,予測可能性,強度を組み合わせ,安全性は別々に残っています. この論文では重要な限界も述べています. 2つのベンチマークは狭いタスクスライスのみをカバーし,ベンチマークごとに1つのエスカファルドが使用され,セキュリティ評価はLLM判定者に依存し,メトリックとアググレーゲーションの選択は主観的で,温度ゼロは精度を最大限に高めるために選択された設定で可用性を過大評価する可能性があります. これらの制限は,配備決定の隣に記載されるべきであり,アーカイブされた方法論記号に記載されるべきではない. 実践的な見直しには,3つの層が用いられる. 1. プロフィール完全性: 12つの指標は検査可能な証拠によって裏付けられているか? 2. 応募しきい値: この任務と権限レベルではどの次元と尾条件が受け入れられるのか? 3. O運用証拠: 現在の導入されたシステムは,達成可能か,進歩可能か,制限可能か,意図された外部結果を生み出せるか? 第二層は必ずしもアプリケーション特有のものです. 必須の人間のレビューを担当する草稿作成助手は,監督されていない退金代理人とは異なる不一致性を許すことができます. この論文は同じ一般的な点を指摘しています 信頼性要件は自律的に拡大する必要があります ランキングボードのスコアを普遍的なリリース値にコピーするのを避ける. 結果的な副作用については,平均前にベトーを使用してください. 合理的な地方政策の一つは この順序は 魅力的な平均値を 知らない状態や 重度の状態を隠さないようにします 紙が測定していない生産証拠を追加する ベンチマークは定義されたプロトコルの下で行動を評価する. 操作者は今何が起きているのか 知らなければなりません この6つの領収書を追加して 紙のメトリクスの外で E 証拠の新鮮さ: 各健康信号が最後にチェックされ,その有効期限が切れたとき. 入手可能性: 実行時間と必要なツールについては,今連絡することができますか. 予定表カバー: 予想された走行が開始,完了,重複,または失敗した. 保有期間: 有法的な依存関係が所有者,期限,再開可能な状態を持っているかどうか. ツール効果の調和: タイムアウトまたは再試されたアクションが目的地をゼロ,一度,または複数回変更したかどうか. 目的地結果検証: 約束されたファイル,データベース変更,メッセージ,テスト結果,または他の配信対象が存在し,受け入れ規則を満たしているかどうかを確認する. この補足は2つのカテゴリーエラーを防ぐ. まず,再確認されたベンチマークの成功は,現在生産の実行時間が達成可能であることを証明していない. 第二に,成功したコマンドまたはモデル応答は,外部効果または配信可能な存在を証明するものではありません. プロジェクトサイトからリンクされたHALハネスのリポジトリは,再生可能な評価,追跡,隔離,コスト追跡を強調しているため,ここには役立ちます. これは強力な評価インプットです 代理人がベンチマークの外で行動する際には,まだ部署特有の結果伝言と現在の運用領収が必要である. 紙をプロフィールとして使って 許可証ではなく リアルなレビューのために 一つのワークフローから始めましょう 1. 実行時間,モデル,エスカファルドコミット,ツールバージョン,タスクセットバージョン,評価日期をピンします. 2. 繰り返し名前の試験を実行し,結果,軌跡,資源記録を保持する. 3. 誤り,環境,及ばない混乱を 調べる前に定義してください. 4. 評価前に自信を掴む 5. 制約と重度レベルを定義し,安全サンプルを人間で検証する. 6. 安全を集積物から切り離してください. 7. 6つの生体健康証拠を 添付してください. 8. 証拠が欠けている場所の unknown を記録する 9. このワークフローの権限と結果に制限と拒否権を設定する. 10. 材料モデル,プロンプト,エスカファルト,ツール,環境変更後にプロフィールを再実行します. 信頼性は形であり,正確性の同義語ではない. 装飾式ダッシュボードになるのを防ぐのです 検証の結果は 信頼性スコアが計算されたものではない. 検証可能な証拠,明瞭な未知,権限拡大前に検証すべき内容の明確なリストを含むバージョン化された決定です. Sidewispの意図された領域は,その境界線の運用面である:アクセス可能性,有用な進歩,文脈,ツール,結果,および他の場所で既に実行されている代理人の周りにコスト. Sidewisp は現在プライベートプレビュー段階です。 生産モニタリングアダプターと復旧システムは一般的には出荷されていませんので,この記事では,現在の自動化された Sidewisp機能ではなく,操作方法について説明します. 証拠の境界線が 誤差に一致する場合は Sidewisp サイトから プライベートプレビューに参加できます ソース Rabanser et al., AIエージェントの信頼性の科学へ, arXiv v3, 2026年6月 ホリスティックエージェント リーダーの信頼性方法論 HAL 再現可能な評価ハネス ICML 2026 ポスターページ OpenReview記録