2026-08-02T00:38:24.615Z

AI エージェントの観察性: 活動だけでなく有用な進歩を測定する

生産的なエージェントが 正当な待機,ステンド,到達できない実行時間,そして誤った成功の結果から 仕事を伝えるための実行時間中立の5信号フレームワーク.

AI エージェントの観測能力は,エージェントが外部証拠から何をしたか説明する能力である:トラス,ログ,メトリック,ツールイベント,モデルコール,遅延,トークン,コスト. その証拠は必要だが それは健康上の判断ではない 要求されたファイルが失踪している間に追跡が完了できる. 道具の呼び出しが成功する 代理人が同じステップを繰り返す限りです 静かに走れば 正しく承認を待っているかもしれません 実践的な答えは テレメトリを保持し その上に小さな意思決定層を追加することです 各タスクに対して,入手可能性,有用な進捗デルタ,宣言された依存性,決定的な結果チェック,同一の窓間のコストなど5つのことを一緒に観察してください. 警報を出す前に,その順に評価してください. このガイドは そのルールを 5つのケースで実行できる 装置にします これは故意に実行時間中立である.同じ推論はOpenTelemetry 範囲,Claude Code イベント,OpenClaw 実行ログ,またはカスタムエージェントを超えることができます. 痕跡が証明したものは 変わったものではなく 現在のGenAIエージェント範囲のためのOpenTelemetryセマンティックコンベンションは,エージェントを作成し,エージェントを呼び出す,ワークフロー,計画,実行ツールを呼び出すための操作を定義します. 文書は Development と記されています 長期間のスケーマを設計する際には重要です 慣習を適合する場所で使用しますが 独自の標準化層の後ろにバージョンに敏感な属性を隔離します ランタイムテレメトリは既に詳細化されています クロード・コードの監視文書はメトリック,イベント,ベータ分布の痕跡を記述する. 追跡ツリーには,インタラクション,モデル要求,ツールコール,ユーザー決定でブロックされた時間,ツール実行が含まれます. 文書化されたフィールドには,期間,トークン,推定コスト,ツール結果サイズ,および success が含まれます. これらのフィールドは重要な質問に答えます ランタイムが反応したのか? どのモデルと道具が動いたのか? 特定のツールボディがエラーを返しましたか? 許可を待って 処刑はどのくらいかかったのか? ランはどれだけのトークンとドルを消費した? 任務の成功を定義するわけではありません 発送コード0を返したシェルコマンドは,そのコマンドが独自の契約で完了したことを証明します. 記事が公開されていること,サイトマップにURLが含まれていること,引き寄せ要求がICを通過するか,意図されたシステムに顧客記録が届いたことを証明するものではありません. アプリケーションはこれらのチェックを追加できますが,一般的なツール成功フィールドはそれらを発明することはできません. したがって,活動と進歩は反対方向に進むことができます. 輸出デルタがない19の成功したツール呼び出しはループである可能性があります. 2つの道具の呼び出しに 沈黙が続くのは 審査員を健康的に待機させるかもしれません 最後のメッセージは 約束された遺物が存在しない場合 偽りの成功かもしれません 5つの信号から1つの健康ウィンドウを作る 結果を見る前に,タスクの特定の観察ウィンドウを選択してください. 5分は小さなコード編集に適し,1時間というのは計画的な研究作業に適した時間かもしれません 長期間の操作を 閉じ込められていると 標識する グローバル 限界を避けましょう その窓内では 5つの信号を集める 信号 最小の証拠 防止する事 入手可能性 心拍子年齢,プロセス/セッション応答,またはスケジュールランスの受信 達成できない実行時間を論理的失敗として扱う 有益な進歩 単調で,タスク特有のデルタ 繰り返し活動を動きと間違える 依存性 待機理由,所有者,期限を入力した 人または外部システムに正当に必要とされる作業を再試す 結果 約束された結果のための決定的予告 配達可能でない完成メッセージを受け付けること 費用 トークン,電話,時間,または同じウィンドウでお金 高価な再試を無視し 進歩を遂げない 有用な進歩は具体的なものでなければならない. プログラミングエージェントでは,テスト結果変更,新しいコミット,またはターミナルに送信された線が未合格のテスト数値を減少させる可能性があります. 公開のAPIのマッチ サイトマップのライブURLです サポートエージェントにとって それは別のモデル応答ではなく 検証されたチケット移行かもしれません ある場合,決定的な結果予告を好む: 機械的に結果を確認できない場合にのみ評価器を使用し,その rubric,バージョン,および不確実性を保存します. 隠された思考の連鎖を ショートカットとして収集しないでください. ツール選択,明示的な計画,出力,タイムスタンプ,および状態変更は,プライベートな推論を必要とせずに運用的証拠を提供します. 費用は窓の外にあるが 費用だけでは健康ではない 10ドルで 移民が確認される 50セントは 変化のない捜索を繰り返すのに 費やされても 異常です 有用な誘導式は: max はゼロによる分割を避ける. progress delta == 0 とコストが上昇し続けると別々に警告する. 働くこと,待つこと,閉じ込められたこと,到達できないこと,そして偽りの成功を分類する 決定の順序は重要だ 入手可能性を確認する その時は 定められた時間内に まだ 依存している 特定のものを 尊重しなさい. 受け入れられる前に 完成を予想した結果と比較してみてください 進歩と過去を解釈するだけです NDJSONの完全な装置です. health window fixture.ndjson として保存する Node.js でこの分類器を実行します: 予想される生産量: 固定装置は論文を偽造可能にする. tool calls 0 のような無明な規則は run stuck と run false success の両方を活性としてマークします. 沈黙のみに基づく規則は run waiting を健康に悪いものとする. 5つの信号規則は 依存性と結果証拠を保持するため 区別します 決定 skeleton ではなく普遍的なスコアモデルです 生産コードは,新鮮さ,信頼性,ソースアイデンティティ,信号が異なった場合, uncertain 経路が必要です. 各状態を境界応答にマップする 分類は誤った行動を防ぐために存在します ダッシュボードを飾るためではありません 州 必要な証拠 デフォルト応答 作業 最近のアクセシビリティとポジティブな進歩デルタ 放置して,後で再びサンプルを採取します. 待ってる タイプされた依存性,所有者,未期限の期限 責任者に対して一度通知する. ブロックされたステップを再試してはならない. 閉じ込められた アクセス可能,そのウィンドウを越えて,依存性,進歩デルタなし 繰り返すステップを検査し,制限内に逆転可能な再試行または推しを行う. 偽りの成功 完了宣言,決定的な結果は失敗 作業を再開して,欠落したプロディケートを報告する. 完成したとは言わないでください. 達成できない 停滞した心拍子やランタイム接触が失敗した 提示を変更する前にホスト/ランタイムの可用性を確認する 不確実性 欠落または矛盾する証拠 欠席した信号を収集または要求する; 復元を自動化しない この分離は,AIシステム以外の有用な先例があります. クーバーネテスはスタートアップ,活力,準備性探査機を区別する プロセスが存在し サービスがトラフィックを受けられるため 決定は異なる. 誤って設計された生命力探査機は 不必要な再起動で 連続的に失敗する可能性があると 文書も警告しています AIエージェントはPodではなく,有用な進歩はタスクに依存する. 移転可能なレッスンは狭いです 曖昧な緑色や赤色の信号がすべての介入を許可させてはならない. 活性回復のために,この行動に制限を加えましょう. 1回の再試し,無制限の再試しループではない. 経過期間とコストの最大限度. 逆転可能なステップ 破壊的または外部行動のための明示された承認境界線 行動後の進捗や成果のチェック. 指揮完了は回復ではない 予想される状態が変わってから 事件をクリアする 契約の道具であって,すべての考えではない 既存の追跡データと並べて 標準化された健康記録を 収録できます アクセス制御された証拠参照を保持し,厳格に要求されない限り,秘密,プロンプト,原始ツール用荷,および絶対的なローカルパスを編集する. 医療記録には,何が確認されたか,権限のある事業者がどこで検査できるかを記載すべきであり,敏感なテレメトリーの第二のコピーにはならない. 4つのことを明確に: 1. 証拠を正常化した実行時間アダプター 2. 進展の定義 3. 成果予測; 4. 分類者規則としきい値. これらのバージョンなしでは テストコマンドの変更や 代名変更が 突然エージェントの逆転のように見えます 方法が止まる場所を知ること 難しいのは もう一回も集まらないことです 価値ある進歩と約束された結果を正直に定義しています 単調な進捗計が存在しない課題もあります 研究代理人は弱い仮説を捨てて,以前の段階に戻るかもしれません. カウンターが落ちても,それは貴重な仕事かもしれません. 依存症のいくつかは 信頼性の高い期限を明らかにしない. ある結果には チェックサムよりも判断が必要である. これらの場合,証拠を保存し, uncertain を報告する. 精度を普遍的な健康スコアで作らないでください. また,オンラインでの健康診断とオフラインの評価を別にしておく. オフラインデータセットは,新しいエージェントバージョンが既知のケースでより正確かどうかを明らかにすることができます. 直接の健康ウィンドウは 別の質問に答えます この特定の走行は達成可能か 動いているか 正当な待機なのか それとも今その結果を見落としているのか? 通常は両方必要だ 一つの結果的なワークフローから始めましょう 進歩デルタと決定的な結果予告を定義する. 既知の作業,待機,閉じ込められた,到達できない,そして偽りの成功のケースを再現します. 分類が現実に一致した後にのみ,警告または制限された回復行動がそれらのいずれかに依存する. Sidewisp は現在プライベートプレビュー段階です。 公開サイトと記事システムはライブですが,生産代理の健康収集,ランタイムアダプター,および回復は一般的には出荷されません. 製品指針は,エージェントの実行時間を置き換えずに,証拠,新鮮さ,信頼性,承認の境界線を操作することを容易にする健康層です. 主要参照 OpenTelemetry: GenAIのエージェントとフレームワーク範囲のためのセマンティックコンベンション は2026年7月24日届きました 文書の状態:開発. クロードコード: 監視 公式のテレメトリフィールドと構成,2026年7月24日取得. クーバーネテス: 活力,準備,スタートアップ探査 公式の調査目的と回復警告は2026年7月24日