2026-08-01T15:00:23.924Z

AIエージェント評価メトリックス: 5つの信号,複合スコアなし

誤った成功,未知のツール効果,または高価な失敗を隠さずに 薬剤のリリースを比較するために 5 つの明示された表記者と 固い証拠ゲートを使用します.

AIエージェント評価メトリックス: 5つの信号,複合スコアなし
AIエージェント評価メトリックは,ダッシュボードを飾るのではなく,リリース質問に答えなければならない. ツールを使用するエージェントにとって,コンパクトデフォルトは,タスク品質,有用な進歩,ツール効果の整体性,検証された結果に対するコスト,誤った成功率という5つの測定が別々に保持されます. 証拠を記録する 平均を最適化する前に 欠落した結果や未知のツール効果を 硬いゲートにします 秩序が重要だ 候補者はより良い散文を書いて 早く完成し テストを受けない成果を出す一方で ランニングごとに安く見えます その信号を平均して ポイントを1つにするなら 安全なリリースが 数値上の改善になります 1つのスコアではなく 5つの指数を保持する 代理の評価には 1つ以上の関心があります アントロピック 剤評価のエンジニアリングガイドは,課題,繰り返し試験,グレード,トランスクリプト,環境の最終状態を区別する. フライト予約の例は,有用な境界線である.トランスクリプトは,フライトが予約されたことを示唆し,その結果は,データベースに予約が存在するかどうかである. 現在のVertex AI代理評価の記述は別の分離を行う. 最終応答評価は,エージェントが目標を達成したか否かを尋ねる.軌道のメトリックは,正確なまたは順序化されたアクションマッチ,精度,召集,単ツールの使用を含む経路を検査する. 両方の見解は有用だが,どちらも黙って他の見解を置き換えるべきではない. この5メトリックの契約を使用します メトリック ナンバーレーター 代名詞 別々に保存する 放出の役割 --- --- --- --- --- 任務の質 バージョン化されたラブリックまたは決定性品質スコアの合計 質の評価者が実際に実行した試験 格付け版,カバー,意見の不一致 強力な証拠が通過した後に最適化 有益な進歩 作業特有の証拠デルタを持つアクティブ観測窓 観測されたアクティブウィンドウ 透明な待機窓と古いコレクター 床,そして最適化 ツール効果の整体性 目的地で確認された外部効果 検証された+失敗した+未知効果の試行 意図的に拒否された電話,未知の効果 硬い床 検証された結果に対するコスト 合計カバーされた運行コスト 目的地で確認された結果 推定コスト,請求保険の欠落 予算レベルと最適化 誤った成功率 成果チェックが失敗した申告された完成品 申告された完成品すべて 検証者が利用できない完成品 拒否権は厳しい 各項目は違う嘘を 阻止します 平均的な質が 格付け対象のない例は 最も簡単な例に報われる. 目的地証拠がないツールが成功すると 成功した呼び出しと成功した効果が混同されます ランのコストは 低コストの失敗に報われる 完成率は,代理人が自分の請求を評価したことで報酬を支払います. 運行テレメトリは 記録に残っています ピンされたOpenTelemetry GenAI メトリックのインスタントショットは,トークン使用,運用期間,エージェント期間,推論-コールカウント,ツール-コールカウント,ツール期間のための開発ステータス機器を定義します. これらの測定は作業量と効率性を説明します ファイルが存在し,請求書が一度作成されたり,予定された報告が目的地に届いたりしているとは主張しません. 限界値を選択する前に証拠記録を書きなさい 試用ごとに1行から始めます 総合図から始めないで下さい. 最小の記録は,すべての数値,指数,排除,および不可用状態を複製するのに十分な情報が必要です. 重要な値は 0.90 ではなく,それを取り巻く意見の不一致です. 応答格レーダーは出力を気に入ったが,結果検証器は利用できず,ツール効果は未知のままだった. この実験は 反応の質について教えてくれるかもしれません 解放の申し立てを裏付けることはできない. 欠席が可能な場合,以下の3つの証拠を用います. - verified とは,指定された予告が意図された目的地と衝突し,通過したことを意味します. - failed は,予告が実行され,期待された状態が欠席または受け入れられないことを意味します. - unavailable は,確認者,収集者,許可者,または目的地の証拠が欠けているため,判決は可能ではなかったことを意味します. unavailable をゼロまたは成功に変換しないでください. ゼロは測定値であり,利用可能でないのはカバーデフォルトです. 待機には同様の注意が必要です 決定の要求,期限,再開可能な状態が 決まりません 待機前のアクティブ・ウィンドウで有用な進歩を計算し,アクティブ・プログロスの時計を停止します. 限界がうまく機能した証拠として否定された高影響ツール呼び出しを保持する.意図的な否定をツール失敗とみなすな. 作業の質は 複数のグレードタイプが必要となる メトリックです 構造化されたフィールド,ファイル,データベース行,HTTP状態,正確なポリシー条件のための決定テストを使用します. モデル格レーダーはトーン,関連性,またはオープンエンドのアーテファクトをスコアすることができますが,そのプロンプト,モデル,ルービックバージョン,および校正サンプルを保存します. 判断が結果的な場合,またはモデル grader による不一致率が理解されていない場合,人間によるレビューは依然として必要である. 放出逆転を再現する この記事に保存されている文物は,合成試験10件を含んでいます. stable-v1 には5件, fast-v2 には5件. Node.js 20 またはそれ以降で実行します: 申告された限界値は: 概要はこうです バリアント 質量 有益な進歩 ツール効果が確認された 料金/走行 費用 / 検証された結果 偽りの成功 検証されていない完成品 ゲート --- ---: ---: ---: ---: ---: ---: ---: --- stable-v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 パス fast-v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 失敗 3つの観察が決定を変えます まず, fast-v2 は表記者が動いているとき より安く見えます. 0.38ドルではなく 0.41ドルです. 支出が検証された結果によって分割されると 結論は逆転する.0.63ドルではなく0.52ドル. より速いバージョンは 信頼できる結果ごとに より多くのコストをかけて 第二に 0.902の質素スコアは 欠落した結果を修復しない. 洗練された完成品が環境検査に失敗した一方,他の完成品には使用可能な検証器がなかった. 質と有用な進歩平均は診断的なままでいるが,外部効果を公表したり,支払ったり,メッセージしたり,削除したり,または他の方法で受け入れたりする権限はない. 第三に, stable-v1 には正当な承認待機が含まれています. 試験終了時の品質指数には存在しないが,待機前の進展と意図的に拒否されたツール呼び出しは,依然として目に見える. メトリック契約は 完成劇場を賞与したり 適切な休憩を罰したりしません この実験は 基準ではなく 反例です 価格,試算,限界値は,会計規則をテストするために構築されています. 生産の誤った成功率を推定していないし, $0.60 は普遍的な予算ではない. 品質を最適化する前にゲート証拠 測定値を固定順に適用する. 1. チェックカバー. 申告された完成はすべて結果判決または明示的に利用できない状態が必要. 効果をもたらす道具の試みは全て 検証された,失敗した,または未知の目的地証拠が必要です 2. Block 誤った成功. 宣言された完了が結果チェックに失敗した場合,リリースを停止します. 答えスタイルではなく 完成予測を調査する 3. Block 未知の効果. 未知の副作用は,発生境界である. 目的地を問い合わせるか,また試す前に idempotency キーを調整する. 4. 進歩とツールフロアをチェックする. 似たような作業を比較し,有効な待機を維持する. 進歩後退またはツール効果の失敗率は,最終的な品質が上昇しても,後退を正当化することができる. 5. O 品質とコストを最適化する. 確認された結果ごとに Rubric Score, Latency, Tokens, Cost を現在のみ比較します. これは故意に重量化された複合体ではありません 体重は関係のない損害間の交渉を招く:十分な流暢性によって,数学的に一回の重複の支払いをキャンセルできます.十分な安価なランスは,欠けている報告を隠すことができます. 政策は,課題品質の項目の内にある重量をまだ使用することができるが,証拠の覆い込みと外部効果は,そのスコアの外に残る. ワークフローの結果とベースラインから 限界値を選択します. 読み込みのみの研究代理は,ほとんどの呼び出しが逆転可能であるため, ツール効果の低い床を許容する可能性があります. 出版,請求,顧客メッセージ,またはアクセス制御代理には,対象試験セットの目的地領収,無効性,そしてゼロの誤った成功目標が必要である. 試験数は十分に大きい場合,信頼間隔を報告し,そうでない場合,原始数を表示する. 5つの試験は 0/5 であり ゼロの人口失敗率の証明ではありません 評価と生産の健康を相互に結びつけるが,区別する. オフライン試験は 候補者が既知のシナリオに 生き延びるか否かを教えてくれます 生産モニタリングは,実際のスケジュール,認証,依存,コスト,および結果がリリース後に健全に維持されているかどうかを教えてくれます. 通過スイートとは,宣言された範囲内で展開する許可であり,将来の実行が失敗できない証拠ではありません. Sidewispの製品指針は,結果,進歩,ツール,可用性,メモリ,コスト証拠を既存のエージェントの実行時間周辺の健康観にまとめるものです. 代わる実行時間や 強制的なゲートウェイや 自動固定装置ではありません Sidewisp は現在プライベートプレビュー段階です。 公開サイトと記事ライブラリはライブです. 生産代理の健康収集,実行時間アダプター,トークンコスト分析,復元実行は一般的に送付されません. まず 5 メトリックの契約を 一つの結果的なワークフローで使用します 最良の平均値のバージョンが 成果やツール効果ゲートに失敗しても メトリックは仕事を果たしました