2026-08-01T21:34:39.053Z

AI 観測可能: 4層の信号契約を作成する

追跡が健康の誤った感覚になる前に スケジュール,実行,依存性,検証された結果証拠を分離する 実行可能な信号カバー監査です

AIの観測性はダッシュボードのカテゴリーではない. 証拠で4つの異なる質問に答えられる能力です: 期待された仕事ですか? 何があったんだ? 合法的な依存を待っているのか? 意図された結果が存在し,検証を通過したのでしょうか? 唯一の2番目の質問に答えるスタックは,予定されたエージェントが始動しない間に美しい痕跡を生むことができます. 人間の承認は気付かれない,または成功したランは,実行可能な結果を残しません. したがって,実用的なデフォルトは4層の信号契約である. 時間表,実行,依存性,結果 . モデルの遅延,トークン,エラー,ツールコール,およびスパンスを保持しますが,それらを契約全体と間違ってはいけません. この記事では,小さなNDJSON装置のルールをテストし,別のプラットフォームを購入または機器を導入する前に調整できる監査を提示します. AIの観測性をカバー問題として扱う AIの観測性に関する検索結果は,いくつかの正当な懸念を混ぜます. モデル品質,データ漂移,GPUとアプリケーション性能,エージェントの追跡,セキュリティ,ガバナンス,コスト. その幅が 観測可能である理由は 評価するのが難しいからです 異なる証拠を収集する際に 2つのチームが同じフレーズを使用できます 予定された作業や委託された作業を遂行する代理人については,意図された作業を分析単位として使用してください. 実行判決を変えられる質問ごとに1層を 要求します 層 証拠の最小値 失敗は暴露できる 予定表 予定時間,期限,開始時間,スケジュール身分 レースは始まらなかった 執行 実行ID,ステップまたはスペン,ツール結果,端末状態,エラークラス 走行が止まったり,ループされたり,再試されたり,失敗したり 依存性 明らかに待機状態,依存性タイプ,承認または外部システム参照 正当な待機は 固定されたと誤ったラベルを付けられました 結果 アテファクトまたは副作用のアイデンティティ,決定的なチェック,検証時間 実行は成功だと言ったが,その作業は欠席または間違っていた. この層は4つの販売業者ではありません 安定したIDを4つの組み合わせで 追踪バックエンドは 執行事件の多くを収めることができます スケジュールを決める人は 予想される時間を知っておくかもしれません 承認システムには待機証拠があるかもしれない. 目的地そのものは物体ストレージ,リポジトリ,チケットのAPI,データベース 通常最も強力な結果チェックを持っています. この枠組みでは,監視と評価が分離され,分断されないようにしています. ルービックベースの品質スコアは,決定的なチェックが存在しない場合,結果検証であることができます. ファイルハッシュ,テスト結果,行数,またはAPI領収書が利用可能であるときに黙って置き換えるべきではありません. なぜ完全な痕跡が 事件を逃すことができるのか 追跡基準は急速に改善しています 74fd2e0 のコミットメントでは,OpenTelemetry生成型 AIセマンティックコンベンションのカバーモデルとエージェント範囲,メトリック,イベント,例外,プロバイダー特定条約,およびMCP. この文書では,GENAIの条約を Development と記している. エージェント・スペン仕様では, create agent , invoke agent , invoke workflow , plan ,および execute tool などの操作を定義する. また, gen ai.operation.name , gen ai.agent.name ,および条件条件で要求される error.type を含む有用な属性も持っています. 固定された代理 範囲源を参照してください. 処刑の証拠だ 探偵に どの操作が起こったのか どれほどの時間がかかったのか 報告されたエラーが作戦を終了したか 教えてくれます フレームワーク追跡は さらに豊かになるかもしれません OpenAI Agents SDK追跡ドキュメントのデフォルトの追跡はランナーの呼び出し,タスクとターンスパン,エージェント,世代,機能ツール,ガードレール,ハンドオフをカバーしている. またカスタムスパンとプロセッサもサポートしています. 失踪した実証を 添付することが可能になります しかし,完成した距離も,ターミナル ok も,最初に予定された走行が予想されていたことを証明していない. また, weekly report.pdf が存在し,新しい報告期間を有し,解析を通過していることも証明されていません. 欠席は追跡の欠陥ではありません 実行テレメトリと運用成果の証明の間の境界線です この境界線は偽造可能です 同じ成功の実行イベントを2回実行し, outcome verified イベントを1回だけ追加し,作戦判決は異なる必要があります. もし現在のアラームが 2つのランを同じ緑状態にすると 誤った成功を検出できません 固定装置で4層の監査を実行する 付属装置には, 2026 07 25T02:42:00Z で観測された4つの走行が含まれています. run alpha は,報告ツールを起動し,呼び出し,終了し,検証されたアーテファクトを記録する. run beta は,同じ成功な実行形状だが,検証された結果はない. run gamma は, approve 42 の承認を明示的に待っています. run delta は,開始イベントなしで予想された期限を過ぎます. Node.js 20 またはそれ以降で監査を実行する: 分類者は各状態で1回回返します: このコードは意図的に退屈な決定命令を使用しています 検証された結果が勝ちます 理由と承認基準の両方で 明確な待機は 待機であり 滞りません 締め切りまでに始まらないレースが 落下した. 成果の証拠のない完成したレースは偽りの成功です. 締め切りを過ぎたスタートは 閉じ込められている. 他のものは健康に昇進するよりも 機能し続けています これは実験です 基準ではありません 4つの手作りケースでは 製造誤差率を推定できないため,実際の分類者は 複製事件処理,時計の歪み許容量,遅刻の結果,および各作業の締め切りを必要とします. 判断は全て検査可能で 一つの出来事を変えれば 結果が変わります 待機を自分の状態として維持する バイナリー健康/不健康なフィールドは,操作者がそれを必要とする瞬間に情報を破壊します. run gamma を考慮してください:プロセスは進歩していませんが,それを再起動することは誤ったデフォルトです. 明らかに承認に依存している. 適切な行動は,その範囲,年齢,権限の境界を保持しながら,適切な人に要求を表すことです. 少なくとも: 料金制限リセット時間,外部職 ID,メンテナンスウィンドウ,上流データ到着については同じアプローチを使用します. "まだ待機している"のような無料テキストメッセージは ルーティング,期限切れ,または関連付けが難しいという 弱い証拠です. タイプされた依存度と不透明の参照は,秘密,プロンプト,または承認コンテンツをテレメトリにコピーせずに制限された応答をサポートします. 活動も過度評価されやすい. 繰り返されるツール呼び出しは,プロセスが忙しくなっていることを示します. 状態や結果のデルタだけが,有用な進歩を示します. ループが永遠にリフレッシュできる一般的な 最後のイベントタイムスタンプではなく,最後の意味のある変更時間とともに,リテリーカウンタが置かれている. 結果チェックを目的地本地にする 最も強力な検証者は 作品が着陸すべき場所に住んでいます ファイルについては,安定したオブジェクトキー,サイズ,消化,解析結果を記録する. 引き出願の場合は,リポジトリ,PR番号,ターゲットブランチ,および必要なチェック結論を記録します. CRM アップデートについては,非秘密のエンティティ ID,予想されるフィールド移行,読み書き後の結果を記録する. 生成品をあらゆる痕跡に 入れないでください. チェックを繰り返すのに必要な最小限の証拠を保管する. OpenAI Agents SDKのドキュメントでは,生成と機能範囲には敏感な入力と出力が含まれている可能性があると警告し,そのキャプチャを無効にする制御を記述しています. 同じ原則をカスタムイベントにも適用します 識別子やダイジェストは 通常提示や応答,認証,絶対的なローカルパス,または顧客コンテンツよりも安全です 成果の検証も新鮮さが必要です 昨日の実行で残されたファイルは 今日の実行が成功した証拠ではありません. 実行 ID,予想される報告期間,作成ウィンドウ,または現在の開始時間以降に計算されたダイジェストを通じて,アーティファクトを現在の実行に結合します. 妥協がある 目的地ネイティブチェックは統合作業を追加し,独立した失敗することがあります. 入手できない検証機を unknown と扱う. 証拠の欠如 最後の成功のチェック そして結果の判断の信頼を 表面化する 特徴を比較する前に契約に対して監査ツール 有用な製品評価は,ロゴ格ではなく4行から始まります. 候補者スタックごとに,各層がどこから来るのか,どのように実行に加わるのか,どれくらい保持されるのか,どのクエリが覆盖性を証明するかを尋ねる. 1. タイムゾーンと期限を含む予想された行列を輸入または抽出できるのか? 2. センサーは 敏感な 役に立たない負荷を捕捉せずに モデル,ツール,転送,再試し,エラーのイベントを追跡できるのか? 3. 依存症とエスカレーションの標的を タイプした待機を表すことができるか? 4. 目的地からの決定的な結果領収を吸収したりリンクしたりできますか? 5. 証拠がないことと健康的な結果を区別できるのか? 6. ツールが変更された場合,オープンフォーマットまたはAPIでデータを輸出できますか? 集中した追跡ツールにはスケジュラーや結果セマンティックが欠けているので拒否しないでください. 結合が信頼性のある場合は 欠けている情報源と組み合わせてください. 必要な区分を表現できない場合,欠落したデータをグリーンステータスの裏に隠したり,日常的な健康検査のために重量敏感なコンテンツを必要とする場合,アーキテクチャを拒絶します. 4層合同は,最初の疑問を解決します: AIの観測能力は,運用代理人にとって期待,実行,依存,および検証された結果を別々に説明できる場合にのみ,完全です. 痕跡は重要な証拠ですが 一層です Sidewisp は現在プライベートプレビュー段階です。 その意図された役割は,既存の実行時間とともに,証拠と人間の権限の限界を持つ健康層である.生産監視アダプタと回復は一般的に今日出荷されていません. このシグナル契約が 検出する故障に一致する場合は 実行時間やモデルゲートウェイを入れずに 早期アクセスリストに加わることができます