2026-08-01T09:31:03.949Z
MLflow LLM 評価: 実行時間-健康リリースゲートを追加
MLflowの評価経路を再現し, 4 つのランタイム領収書を追加して,合格スコアが偽緑のエージェントの判定にならないようにします.
MLflow LLMの評価は,アプリケーションの出力が選択した基準を満たしているかどうかを教えてくれます. 代理人が間に合うこと,間に合うこと,外部副作用を完了すること,または約束された配達品を目的地に残すことなど,それだけでは証明できない. 実用的なデフォルトは,MLflow評価結果とランタイム・ヘルス判定を2つの証拠層として保持し,リリース前に両方を要求することです. MLflow 3.14.0でその境界線をテストしました コードベースのスコアーは 3人のエージェントに exact deliverable/mean の完璧な 1.0 を 与えました 4つの領収書の別々の健康規則は そのランの1つしか 通り過ぎないことを許しました 違いは MLflowの欠陥ではありませんでした スコアが回答した質問と より広範な作戦決定の間の不一致でした 文書化されたMLflow評価経路を再現する MLflowの現在の評価ガイドは,データセット,スコアリスト1人または複数の人,オプションの予測機能から評価を定義する. データセットはインプットと期待を提供します 予測機能は,既に存在していないときに出力を生成します. スコアリングは利用可能な証拠をフィードバックやメトリックに変換します この分割は,評価質問が明瞭になるため,有用です. この出力が期待される配信可能な名前に等しいか?という質問であれば,LLM判定よりもデターミニストコードベースのスコアが適切である. MLflows カスタム・スコアリングドキュメントは,スコアーは inputs , outputs , expectations ,または完全なトラスを読み取り,原始的な結果またはより豊かな Feedback を返せる. 試みはインライン・リスト, プリジェネレーション・アウトプット, そしてこのスコア: MLflowは exact deliverable/mean = 1.0 を記録した. これは定義された証拠の正しい結果です 各出力文字列は期待に応えていました 結果は再現可能で 低価格で説明が簡単です 3つのエージェントランも健康的です. MLflows 評価データセットのドキュメントは,逆転防止,バージョン比較,ターゲット品質テストのための選択された例としてデータセットを記述する. これが正しい心理モデルです データセットは,その例やスコアでコードされている主張のテストセットであり,それは自動的にすべての生産失敗を数えることではありません. 査定結果の横に運用領収書を置く 同じ装置は,各作業に小さな実行時の領収書を添付しました. 記録した4つの事実が,正確な出力スコアが確認しなかった: heartbeatFresh : 実行時間は最近達成可能である. scheduleOnTime : 許容されたウィンドウ内で開始された予想の走行. effectVerified :外部目的地では意図された副作用が確認されます. deliverableVerified : 約束されたアーテファクトは存在し,目的地チェックを通過する. 結果的に比較は: 任務 正確な配達可能 実行時間の証拠 解放決定 run 101 パス 4つの領収書も 放出 run 102 パス 心拍数が衰え,効果と出荷能力は検証されていない. ブロックはアクセスできない run 103 パス 予定は許可された窓を逃した 遅刻まで 3つの評価行も合格しました 1回しか逃れなかった 作業員が失踪した後に キャッシュされた応答で 正しい文字列が生き残れる. 営業期限が過ぎると 適切な用荷が届くことができます ツール通話は,目的地が変わっていない間に可視な確認を返せる. これらの事件のどれも,出力スコアを無効にするものではなく,解放決定に追加の証拠が必要である理由を示す. 安定した task id または run id によって結合された層を保持する. コンパクトレコードはこんな感じです 合同の鍵は大事だ 医療保険証を他のバージョンや環境からの評価や 再試の評価と比較する アプリケーションバージョン,データセットバージョン,スコアバージョン,環境,および観察時間を含みます. これらの次元が判断を変えることができる場合. MLflowは評価と追跡証拠を保持することができる. 実行時間または目的地は,ただそれだけが知っている事実を提供しなければならない. 欠落した証拠は unknown ではなく pass として扱います. 心拍数が欠落すると 代理人ではなく コレクターが失敗する可能性があります 目的地領収書が欠けていた場合,書き込みが失敗した,検証者が失敗した,または統合が事実を明らかにできないことを意味する可能性があります. これらの国は調査を要求し 緑の放出を正当化しない. 混合スコアではなく2ゲートで決めてください 実際の放出規則は 意図的に退屈です 各項目は独自の証拠,鮮明さ,失敗の理由を保持すべきです 操作者は次の操作を制限します 評価失敗はプロンプト,モデル,ツールポリシー,データセット,スコアに戻ります 心拍数が衰退し 走行時間や 収集者診断に繋がります スケジュラー,キュー,または容量制限へのスケジュール路線が逃れた. 検証されていない効果は,外部目的地が調和するまで再試を阻止します. 生産者または目的地検証者に送付可能な経路が欠落している. この分離はまた,LLMの裁判官が,そう意図されていない権威になるのを妨げます. 正確性や質が意味的評価を必要とする場合 判事は価値あるものです MLflowは内蔵されたガイドラインベースのカスタムおよびコードベースのスコアを明示的にサポートしています. その基準に合わせて そのツールを使う. ファイルの存在,データベース状態,APIリソース,テスト結果,署名された領収書の決定的な目的チェックを好む. 実験を読みないでください. MLflowは生産監視が欠けているため.MLflow文書の評価,追跡,監視,データセット,フィードバック,およびいくつかのスコアタイプ. 狭い結論は偽りである:ここで実施された正確な評価は,データとスコアがそれらをテストしなかったため,4つの運用事実を確立しなかった. 関連する証拠が存在する場合,健康指向のスコアを追加するか,証拠が実行時間および外部システムに存在している場合, MLflowと共に健康分類を保持することができます. 装置は故意に小さい. LLM審査員をベンチマークしたり,規模でMLflowをテストしたり,ベンダーを比較したり,モニタリングカバーを測定したりしない. その値は制御不一致である: 3つの同一評価パス,3つの異なる動作状態,および解放決定を説明する 1 つの検査可能な規則. チーム運営者にとって,この境界線は有用です. 最も強力な適切なスコアで輸出品質を評価し,その情報源で運用事実を確認し,成功を宣言する前に証拠に合致します. Sidewisp は現在プライベートプレビュー段階です。 計画された役割は,既存の実行時間とともに健康層であり,MLflowの代わりではなく,合格評価が健康な薬剤であることを自動的に主張するものではありません. 現在の公衆の経験は,早期アクセスサイトと製品示範です. 生産監視アダプターは一般的に出荷されません.