2026-07-31T20:58:59.013Z

Splunk LLM 観測可能: 評価者からの呼び出しをエージェントの健康状態から排除する

Splunk評価器の分離,ヒストグラムのテレメトリ,サンプリングカバー,カーディナリティ,コンテンツキャプチャ,および結果証明を信頼する前に.

Splunk LLMの観測能力は,道具化されたエージェントの有用なパフォーマンス,品質,トークン,推定コスト,および追跡証拠を示すことができる. 安全な運用デフォルトは, AI エージェントのページが満載していないため,エージェントは健康です. まず測定パイプラインが完了し,評価者の呼び出しがアプリケーションワークとしてカウントされていないことを証明し,評価のカバーが既知のネミナーを有し,要求された結果が痕跡の外にあることを証明します. このガイドは 提示や答えを集めずに その証拠を構築します 含まれている8つのケースの固定装置は,コンテンツフリー受信を生成し,各ルートがこれらの状態の1つに行きます. 摂取は不完全,メトリック契約の不一致,評価者自身が観察した,高カルダナリティリスク,コンテンツポリシーレビュー,評価覆盖が減少,観察可能が確認されていない,または覆われたおよび検証された証拠で健康である. スコアを読む前に測定経路を監査する スプランクの現在の設定ドキュメントは 2つのテレメトリの詳細を 操作的に重要なものとする. まず,AIエージェントモニタリングページにはヒストグラムメトリックが必要です. SignalFx輸出機を使用する場合,文書化されたコレクター設定は send otlp histograms: true です. 設定では,次の方法でデルタタイムロリティも指定します. 見られる痕跡は,このメトリック経路が正しいことを証明するものではありません. 範囲とヒストグラムは独立して失敗することができます. Python AI 機器は,アプリケーションと同じプロセスで評価を実行できます. Splunk は このスイッチを文書化します このデフォルトモードでは,DeepEvalなどの評価者によるLLM呼び出しは,アプリケーション呼び出しとともに機器化することができます. OpenTelemetry SDKが無効化された子供プロセスで,評価者の呼び出しがアプリケーションのテレメトリーを汚染するのを防ぐために, true run 評価を設定します. Splunkは,他の文書化されたフレームワークで評価が有効でオプションである場合,OpenAI機器の必要に応じてこの隔離をマークします. この区別は グラフの意味を変えます モデルを2回呼び出したら 評価者は3回呼び出します 評価者は 機器化されたプロセスを共有する場合は 純真な総数は 5 つの呼び出し,その組み合わせたトークン,およびそれらの組み合わせた遅延を報告することができます. 余剰活動は実数ですが 代理人がより進歩した証拠ではありません 測定作業を観察する測定作業です 部署ごとにコンテンツフリー領収書を記録する 提示,応答,ツール 議論,秘密,または顧客識別子を必要としません. 証拠パイプラインの健康を記述しています 最初の3つのチェックは様々な質問に答えます histogramsExported : AIの監視ページで要求されるヒストグラムテレメトリを収集者が輸出したのですか? deltaTemporality : メトリック契約は文書化された構成と一致していますか? aiSpanVisible : 少なくとも1つの新しい GenAI 範囲が予想される Splunk ビューに達したのでしょうか? telemetry ok ボール式にこれを分解しないでください. 範囲が到着するが,ヒストグラムが到着しない場合,収集パネルが不完全のままの間に,追跡調査が可能である. データが古い場合,満載したページはまだ古い可能性があります. 証拠源と観察時間を実際の実施で領収書に並べて保管する. 各品質スコアに覆盖率指数を与えます Splunkは,AIエージェント品質スコアをメトリックで合格した評価の割合として記述する. AIエージェントのドキュメントによると ランスはこれらのスコアを計算するためにサンプルを採取され 80%未満のスコアが質の問題であることを示しています これは評価されたサンプルにとって有用なルールかもしれません. 対象となるすべての請求が評価されたり,サンプルがすべてのタスクタイプを表しているかを証明するものではありません. 4つの数字を一緒に追跡する 1. 応募期間 2. 設定された評価サンプル率 3. 完了した評価結果 4. 評価行が下がる 決定的な監査ウィンドウについては,次のことを計算する. 対象範囲は400個,サンプル率は0.25個,評価数は100個,減少はゼロで,観測対象範囲は25%であり,設定された期待に一致する. Znot は他の300回を過ぎたという意味です 評価状態はサンプルの外にあるということです Splunk の Python 構成では評価列のサイズも表示されます. 順番が満員になったとき,新しいアイテムが警告で落とされます. ドキュメンテーションでは,吞吐量とメモリに応じて1001000範囲の境界線を推奨し,ゼロまたはアンセットは,列を無制限にする. どちらの選択にも妥協がある 制限のないキューは評価遅延をメモリ圧力を変換することができる. 制限された排列はプロセスを維持できますが,評価の覆盖を減らすことができます. 順番を6回数えるなら94回の完了した評価が100%のサンプリング率で100回の合格評価を真摯に代弁できない. 監査では EVALUATION COVERAGE DROPPED が健康的で失敗した代理店ではないと報告されています. 代理人は有用な作業を完了したのかもしれません 質の判断に必要な証拠は不完全です メトリックの次元には 同じ境界が必要です Splunkは,GenAIのコンテキスト属性をメトリック次元にコピーすることを可能にしますが, gen ai.conversation.id は高カルディナリティの問題を引き起こす可能性があると明示しています. 診断のために必要なとき,会話ごとに識別をスパンで保持します. 自動的にメトリック次元に変換しないでください. 低カーディナリティの部署環境または賃貸者層は,通常,統合のためにより安全である.正しいセットは,依然としてトラフィックと賃貸者制限に依存する. 内容をキャプチャする 明確な例外を保持する SplunkのLLMサービスドキュメントでは,プロンプト・アンド・レスポンスの収集がデフォルトでオフになっていると書かれており,コンテンツには敏感な情報や個人識別可能な情報が含まれると警告しています. 設定経路は,大きなキャプテッドインプットとアウトプットがバックエンドの限界を超え,パフォーマンス問題を引き起こすことも指摘している. この監査には内容は必要ありません. ヒトログラム輸出,時間性,プロセス分離,サンプリング,ドロップ,次元,追跡可視性,および目的地領収書をメタデータのみを使用して検証することができます. 品質に関する別々の調査が実際に収録されたコンテンツを必要とする場合,内容政策のレビューを通じます. 内容を必要とする正確な評価者を特定する. 捕獲は,距離,出来事,または両方において発生するかどうかを記載する. 文書の保存,アクセス,マスクリング,削除 試験用荷物のサイズ動作 ツール定義がメッセージキャプチャを有効にしただけでキャプチャされないことを確認する. 制限調査後,継続的な収集が正当化されない場合,捕獲を無効にする. 装置は,承認領収書なしで捕獲を可能にした場合, CONTENT POLICY REVIEW を返します. その判決は 意図的に 健全でも 壊れることもありません 装置は 操作健康検査が許可できない データ境界を越えたと書いてある 同じ制限は推定コストに適用されます. Splunkは,その代理コスト推定は,公開されたプロバイダーコストを,利用可能なトークン数値に倍増し,実際の請求を表さないと述べています. 価格設定の日付を保持し,請求書やプロバイダー別キャッシュ割引と黙って調整しないでください. 8件の証拠監査を実施 複製可能なアーティファクトは 1 つの優先順位規則を使用します 過去の発見は 後に緑の状態を阻害します 保存した設定を実行する: 8つのケースを再確認し 8つの異なる結果が得られます 覆われ確認された HEALTHY COVERED VERIFIED : 必要なテレメトリ,宣言されたサンプル,ゼロドロップ,結果合意. Evaluator self observed EVALUATOR SELF OBSERVED : 審査員通話はアプリケーションのテレメトリに入力できます. histograms missing INGESTION INCOMPLETE : A 痕跡は,必要なメトリックが到着した証拠ではない. Z誤った一時性 METRIC CONTRACT MISMATCH : 輸出されたメトリック契約は文書化された設定とは異なる. 会話 id as metric HIGH CARDINALITY RISK : 対話の個性をメトリック次元に推進した. コンテンツキャプチャ 未審査 CONTENT POLICY REVIEW : 領収書なしで敏感データ境界を越えられた. 評価列を落とした EVALUATION COVERAGE DROPPED : 94 の結果は,予想される100 を表すことはできません. Ztrace without outcome OBSERVABLE NOT VERIFIED : 実行証拠は存在するが,約束された結果は存在しない. これは合成構成監査で リアルタイムで Splunkのコンプライアンステストではありません コレクターがアクセス可能であることを証明することはできません. 役割には必要な能力が含まれています. 保存はインシデントウィンドウをカバーしています. 固定値を環境からの観測で置き換えて,値が測定できない場合, unknown を保存する. 検察官の判断前に 追跡を停止する Splunk の追跡と AI インタラクション ビューは,モデル操作,エラー,トークン使用,遅延,評価応答品質に関する重要な質問に答えます. 捜査官と健康上の判決には もう一つの境界線があります 要求された作業が完了したのか? 最も強力な決定的な目的地チェックを選択してください. ファイルが予想されたパスで存在し,スケーマまたはハッシュに一致する. 預期されたリポジトリで引き出し要求が存在し,コミットする. 意図された目的地で予想される無効性キーを持つメッセージが存在します. 計画された賃貸者および運用 IDの下にはデータベース変異が表示されます. 製造されたアーテファクトに合格した試験装置 試験は waiting で 失敗していない 確認証を 追跡に 添付して プライバシーを最小限にする 配信可能な内容を源に保管する. 成功した期間と欠けている領収は OBSERVABLE NOT VERIFIED です. また試すための自動許可ではありません. 外部効果は存在しますが,一時的に読み取れないからです. 実践的規則は単純です. 測定経路が経った後,Splunkの視点を信頼し,既知の範囲内で品質スコアを解釈し,意図された結果が別々に確認された場合にのみ,エージェントの健康を明確にします. Sidewispは,同じ証拠先の製品方向性を遵守し,活動と有用な進歩を区別し,欠けている証拠を暴露し,結果検証を追跡完了から分離する. Sidewisp は現在プライベートプレビュー段階です。 生産モニタリングアダプターと復旧エンジンは,一般的に利用可能であるようにここで紹介されていません. ソース AI エージェントモニタリングを設定, スプランクオブザーベビリティ・クラウドドキュメント AI アプリケーション 0.1.14 以降の Python エージェントを設定する, スプランクオブザーベビリティ・クラウドドキュメント AIエージェントを監視する,最後に更新されたのは2026年6月16日. LLMサービスを監視する,最後に更新されたのは2026年5月12日.