2026-08-01T14:17:52.005Z
LLM 自己評価: 信頼する前に判事を調整する
判断を決定的な証拠,基準に準拠したLLM判事,または責任ある人間レビューに導く.
LLMの自己評価は,基準が真に質的であり,評価者はその正確な基準のためにヒトの標識とテストされ,その答えが裏付け証拠として扱われる場合,有用である. ファイルが存在し,支払いが登入し,テストが合格し,または不可逆の措置を承認した人が存在するかどうかを決定すべきではありません. これらの質問には既に より強い主人がいます 決定的なチェックや責任ある人間です したがって,実際のデフォルトはルーターであり,普遍的な判事ではありません. 機械的に確認可能な請求をコードに送信する. カリバー化されたモデル評価者に限定された質基準を送信する. 明らかに 不安定 な 影響 を 及ぼす 決定 を 人 に 送る 証拠が欠けているなら 判決は unknown に保存してください LLMの判事は権威ある者でないのに有用な 自動評価とは,LLMを自社または他のモデルの輸出を評価するよう要求することを意味します. 2番目のパスで明らかな矛盾を捉え,2つの要約を比較したり,答えを Rubric と評価したりできます. プンプティング の 概要 を 学びは基本的なパターンを示します 答えを生成し,モデルに批判や修正を依頼します 研究により このパターンは 信頼性の高いが 限られた役割を果たしています レンと同僚は,トークンレベルでの予測としてオープンエンドの自己評価を再構築し,テストされた PaLM 2および GPT 3設定において,TruefulQAおよびTL;DRで選択生成の精度と出力品質との強い関連性を改善した. 複数のステップの作業に関する最近の研究では,段階的な自己評価は,2つのベンチマークデータセットにおける故障検出に関する全般的なスコアを上回ったことが判明し,AUC ROCの相対的な増加率は最大15%に達した. 両方の結果は,モデル意見を配達領収書に変えることはありません. 自動評価は特定のタスク,提示,モデル,データセットに基づいて意思決定を改善することができると示しています "LLM判事"ではなく テストされた評価器の構成です 障害モードも知られています MT BenchとChatbot Arena紙は,強大な審査員が 80%以上の人の好みとの合意に届いたと報告し,ポジション,言語性,自己強化,推論偏見を記録している. 合意は励ますし,偏見リストは操作的に決定的なものです. 裁判官は平均的に役に立ちても 重要な判決を 逆転させることができます 位置偏見は簡単にテストできます AとBの候補者を評価し 内容を変更せずに順番を交換し また評価します 王と同僚は,順序の変化が対等ランキングを実質的に変えることができ,バランスポジションの校正と人間のエスカレーションを提案した. 交換後に優先候補が変更された場合, unstable を記録する. 矛盾を自信を持って 評価するな. 判事を校正する前に基準を凍結する "質"は 校正できないほど広大です 明確な要約を認める裁判官は 事実の根拠や政策の解釈や証拠の十分さについて まだ信頼できないかもしれません 狭い契約で1つの基準を定義する. 校正セットには,評価者が書いた例,基準を所有する人のラベル,そして,ほろろすりや過度に許容的な評価を暴露するのに十分な難しいネガティブが必要です. モデル識別子,判定プロンプト,ルーブリック,例,出力解析器,しきい値を一緒に凍結する. そのいずれかに変更すると 新しい評価者バージョンが生まれます 人間のラベルは この過程で 恥ずかしいものではなく ターゲットを定義します EvalGenの著者は"基準漂移"を記述する:人々は実際の結果を見た後,しばしば基準で何を意味するのかを明確にする. これはバージョン基準やラベルの理由であり モデルスコアの裏にある判断を隠す理由ではありません 基準ごとに少なくともこれらの性質を測定する. 長期にわたるヒトラベルに対する合意 誤った合格率は,誤った出力を承認する評価者が誤った成功を生み出しているからです. unknown の利率で,欠けているカバーが明らかになる. 候補の順序と無関係なフォーマット変更時に安定性 言語,タスクファミリー,インパクトクラス,および出力長さによるカバー 意見の不一致のクラスタは,次のレビューのために例として保存されます. 関連のない基準を安心させる平均で組み合わせてはならない. 明確性が100%一致し 基礎性も75% 安全性も2つの例しかありません 88%のミックススコアは 防御可能なセキュリティゲートがないことを 隠すことができます 3列を別々に保つ. 限界値は政策選択であり 論文から定数ではなく 低影響型スタイル提案に対して 80%の同意を受け入れ,展開効果のための決定学的証明を必要とする. 重要な性質は 解放候補者が得点を得る前に 限界値が凍結されるということです 校正ゲートを再現する 次の装置は4つの基準と8つのルーティングケースを使用しています. その限界は意図的にシンプルです 少なくとも3つの人間標識の例,少なくとも80%の同意,順序の逆転で勝者変更はありません. 決定規則は小さい. 完全な装置を: 複製は: 2つの観測は コンパクト数よりも重要だ まず,この装置には 裁判官が pass と呼ぶ 欠落した配送書が含まれています. ルーターは決定的な fail を返します. また,審査員が嫌うチェックサムマッチが含まれています. ルーターは決定的な pass を返します. モデルがプレゼンテーションについてコメントできるが,約束されたオブジェクトが存在するのか一致しないのかという証拠を否定することはできません. 二つ目は,ペア式品質は4つのラベル付きの例に完全に一致しているが,候補者が順番交換するとき,勝者を変更する. ゲートはまだ壊れてる 歴史的な合意は現在の矛盾を許さない. この小さな再現は 80%があなたのアプリケーションに安全であることを証明するものではありません. 判断が正しい証拠の所有者に届いたことを証明するための 検査可能なパターンです 直接決定を 証拠の持ち主へ 送る 校正が完了すると 走行決定は3つのレーンを保持する Deterministic lane. ファイルシステムチェック,スキーマ検証,テスト結果,データベースの制限,プロバイダー領収書,署名,チェックサム,そして宛先の読み取りを直接質問に答えることができるときに使用します. 観察された値と新鮮さを記録する. 0 から出かけるコマンドは,そのコマンドの契約のみを証明する.意図された外部結果を別々に確認する. 判定支援レーン. 校准覆盖が現在のケースに一致する際には,明確性,関連性,音調,またはラブリック遵守などの基準に固定された評価器を使用します. 基準,評価者バージョン,プロンプトハッシュ,入力参照,判決,説明,および校准セットバージョンを保持する. モデルが判決を支持し その証拠が許容するものを 周囲の政策が決定する. Human review lane. ルートは大きな影響を持つ意見の不一致,新しい言語,未知タスクファミリー,秩序の不安定,政策例外,そしてここでの不可逆の権威です. 矛盾する証拠と具体的な質問を挙げてください. "この事件は終了できるのか?"と裁判官が言う間に 決定的な領収書が欠落している. unknown 結果は有用です システムでは現在主張を証明できないと書かれています 無名なものをパスすると ダッシュボードが不完全に見えないようにするだけです 漂流で再調整するだけでなく,カレンダーで モデル・アライアスが変更され,プロンプトが編集され,例が再編され,新しい言語が到着し,出力が長くなり,または製品が異なるタスクファミリーを処理し始めたとき,判事は漂流することができます. これらの変更について再調整を誘発し,予定されたレビューの間での生きた不一致サンプルを監視する. 2つの境界線を表示してください 1. 自己評価は,限られた質的性質を推定する. それは,可用性,有用な進歩,ツール効果,記憶の持続性,または提供可能な存在を証明しない. 2. カリバー化された評価者はレビューの負担を軽減し,秘密,支出,出版,削除,または他の不可逆の行動に関する人間の権威を受け付けません. 結果は AIの評価の劇的な形式ではない. 判事は有用な仕事を得 決定的な証拠は 強く機能し 人々が自分たちにある決断を 保持します Sidewisp は現在プライベートプレビュー段階です。 既存のエージェントの実行時間周辺の健康層として開発されていますが,生産エージェントの健康収集と回復は現在のウェブサイトリポジトリに送信されていません. 証拠のルーティングの問題が 代理人を操作する方法と一致する場合は 直接監視の統合の主張として 記事を扱わずに プライベート・プレビューの待機リストに加わることができます