2026-08-02T00:38:25.365Z

AI 에이전트 관찰성: 활동뿐만 아니라 유용한 진전을 측정합니다

생산적인 에이전트들이 합법적인 대기, 상점, 도달할 수 없는 실행 시간, 그리고 잘못된 성공 결과를 통해 일하는 것을 알리는 실행 시간 중립된 5 신호 프레임워크.

AI 에이전트 관측성은 외부 증거에서 에이전트가 무엇을 했는지 설명하는 능력입니다: 흔적, 로그, 메트릭스, 도구 이벤트, 모델 호출, 지연, 토큰 및 비용. 그 증거는 필요하지만 건강 판결은 아닙니다. 요청된 파일이 없어진 동안 추적이 완료될 수 있습니다. 도구 호출은 에이전트가 같은 단계를 반복하는 동안 성공할 수 있습니다. 조용한 달리기는 승인을 기다리고 있을 수 있습니다. 실질적인 대답은 텔레메트리를 유지하고 그 위에 작은 의사 결정 층을 추가하는 것입니다. 각 작업에 대해 다섯 가지를 함께 관찰하십시오: 접근성, 유용한 진행 델타, 선언된 의존성, 결정적 결과 검사, 같은 창에 대한 비용. 경고하거나 복구하기 전에 그 순서대로 평가하십시오. 이 가이드는 그 규칙을 실행 가능한 5개의 사건으로 바꾸어 놓습니다. 그것은 의도적으로 런타임 중립적: 동일한 추론은 OpenTelemetry 범위, 클로드 코드 이벤트, OpenClaw 런 로그, 또는 사용자 지정 에이전트 위에 앉아있을 수 있습니다. 흔적은 무슨 일이 일어났는지 증명하고, 무엇이 바뀌었는지 아닌 현재 GenAI 에이전트 범위를 위한 OpenTelemetry 의미 협약는 에이전트를 생성하고 호출하는 작업을 정의하고, 작업 흐름, 계획 및 실행 도구를 호출합니다. 이 문서에는 Development 가 표시되어 있습니다. 이는 오래 지속되는 스케마를 설계할 때 중요합니다. 런타임 텔레메트리는 이미 상세해지고 있습니다. 클로드 코드의 모니터링 문서는 메트릭스, 이벤트 및 베타 분산 흔적을 설명합니다. 트레이스 트리는 상호작용, 모델 요청, 도구 호출, 사용자 결정에 대한 시간 차단 및 도구 실행을 포함할 수 있습니다. 문서화된 필드는 기간, 토큰, 추정 비용, 도구 결과 크기와 success 입니다. 이 분야는 중요한 질문에 답합니다. 달리는 시간이 반응했나요? 어떤 모델과 도구가 사용되었나요? 특정 도구 신체가 오류를 반환 했습니까? 허락을 기다리고 처형하는 데 얼마나 걸렸나요? 얼마나 많은 토큰과 달러가 실행에 사용되었습니까? 그들은 당신의 임무의 성공을 정의하지 않습니다. 출력 코드 0을 반환하는 셸 명령은 자신의 계약에 따라 완료된 명령을 증명합니다. 문서가 공개된지, 사이트 지도가 URL를 포함하고 있고, 당첨 요청이 CI를 통과하거나, 의도된 시스템에 도달한 고객 기록이 증명되지 않습니다. 애플리케이션은 이러한 체크를 추가할 수 있지만 일반적인 도구 성공 필드는 그것들을 발명할 수 없습니다. 따라서 활동과 발전은 반대 방향으로 움직일 수 있습니다. 출력 델타가 없는 19개의 성공적인 도구 호출은 루프일 수 있습니다. 침묵이 이어지는 두 가지 도구 호출은 평론자를 위해 건강한 기다림일 수 있습니다. 마지막 메시지는 ' Done'가 약속된 유물이 없는 경우 잘못된 성공이 될 수 있습니다. 5개의 신호에서 1개의 건강 창을 만들어 결과를 보기 전에 작업에 대한 관찰 창을 선택하십시오. 작은 코드 편집에 5분 정도가 적합할 수 있고, 일시간은 일정 연구 작업에 합리적일 수 있습니다. 모든 긴 작업이 걸린다고 표시되는 글로벌 임대 문턱을 피하십시오. 그 창 안에서 5개의 신호를 수집하세요. 신호 최소한의 증거 무엇이 그것을 막는지 접근성 심장 박동 연령, 프로세스/시션 응답, 또는 스케줄러 실행 수신 접근할 수 없는 실행시간을 논리 실패로 간주하는 것 유익 한 발전 일조적인, 작업에 특화된 델타 반복된 활동을 운동으로 오해하는 것 의존성 기기된 대기 이유, 소유자 및 정해진 시간 합법적으로 개인이나 외부 시스템이 필요한 작업을 다시 시도하는 것 결과 약속된 결과의 결정적 표본 전달할 수 없는 완료 메시지를 받아들이는 것 비용 같은 창에서 토큰, 통화, 시간, 또는 돈 진전을 이루지 못하는 값비싼 시도를 무시하는 것 이용적인 발전은 구체적이어야 합니다. 코딩 에이전트에 대해서는 테스트 결과 변경, 새로운 커밋 또는 터미널에 방출된 라인 중 실패 테스트 수 감소가 될 수 있습니다. 출판사에게는 CMS 드래프트 ID가 될 수도 있고, 공개 API 일치가 될 수도 있고, 사이트 지도의 라이브 URL가 될 수도 있습니다. 지원 에이전트에게는 다른 모델 응답이 아닌 유효한 티켓 전환이 될 수 있습니다. 결정적 결과 predicate가 존재할 때 선호합니다: 평가기를 기계적으로 검사할 수 없는 경우에만 사용하며, 라우브리, 버전 및 불확실성을 저장하십시오. 숨겨진 사슬의 생각을 단축으로 수집하지 마십시오. 도구 선택, 명시적인 계획, 출력, 시간표 및 상태 변경은 개인 추론을 필요로 하지 않고 운영 증거를 제공합니다. 비용은 창문 안에 있지만 비용만으로는 건강이 아닙니다. 확인된 마이그레이션을 일으키는 10달러가 예상될 수 있습니다. 변함없는 검색을 반복하는 데 쓰인 50센트는 이상일 수 있습니다. 유용한 파생된 측정은 다음과 같습니다. max 는 0으로 나뉘는 것을 피하고, 0의 진전을 건전하게 만들 수 없습니다. progress delta == 0 및 비용이 계속 증가할 때 별도로 경고합니다. 일, 기다림, 갇혀 있는 것, 도달할 수 없는 것, 거짓의 성공 결정의 질서가 중요합니다. 먼저 접근성을 확인해 보세요. 그러면 정해진 시간 안에 있는 명백한 의존성을 존중하십시오. 이를 받아들이기 전에 주장된 완성도를 결과를 예측하는 것과 비교해 보세요. 그 다음으로 진행과 시간이 지나간 것을 해석할 수 있습니다. 여기 전체 NDJSON 장치가 있습니다. health window fixture.ndjson 로 저장하세요: 이 분류자를 Node.js로 실행하세요: 예상 출력: 이 단말은 논문을 왜곡할 수 있게 해준다. tool calls 0 와 같은 순진한 규칙은 run stuck 와 run false success 를 모두 활성으로 표시합니다. 침묵에 근거한 규칙은 run waiting 를 건강에 해롭지 않다고 표시합니다. 다섯 신호 규칙은 의존성과 결과 증거를 보존하기 때문에 그들을 분리합니다. 예를 들어 결정 스켈레톤이 있습니다. 보편적인 점수 모델이 아닙니다. 생산 코드는 또한 신선함, 신뢰성, 소스 아이덴티티, 그리고 신호가 동의하지 않을 때 uncertain 경로가 필요합니다. 각 상태를 한정된 응답으로 지도 분류는 잘못된 행동을 방지하기 위해 존재합니다. 래시보드를 장식하기 위해서가 아닙니다. 국가 증거가 필요 기본 응답 작업 최근 접근성 및 긍정적인 진보 그냥 남겨두고, 나중에 다시 샘플을 기다림 타이핑된 의존성, 소유자 및 만료되지 않은 유가 기간 책임자에게 한 번 알리십시오. 차단 된 단계를 다시 시도하지 마십시오. 꽉 차있어요 접근가능한, 그 창을 넘어서, 의존도 없고, 진보도 없다 반복되는 단계를 검사하고, 한 번의 되돌릴 수 있는 시도 또는 제한 내에서 밀어 넣을 수 있도록 준비하십시오. 거짓 성공 완료 선언, 결정적 결과 실패 과제를 다시 열고 실종된 표본을 보고하십시오. 완료된 과제를 호출하지 마십시오. 접근할 수 없는 것 고장된 심장 박동 또는 실행 시간 접촉 실패 명령어를 변경하기 전에 호스트/런타임 가용성을 확인합니다. 불확실성 실종 또는 모순된 증거 실종 신호를 수집하거나 요청하지 마십시오. 자동으로 복구하지 마십시오. 이 분리에는 AI 시스템 이외의 유용한 선례가 있습니다. 쿠버네티스는 스타트업, 활력, 준비 탐사선을 구분한다 프로세스가 존재하기 때문에 서비스가 트래픽을 수신해야 하기 때문에 는 서로 다른 결정이다. 그 문서들은 또한 잘못된 설계된 생명 탐사선이 불필요한 재발전으로 캐스케이드 실패를 일으킬 수 있다고 경고합니다. 비유는 한계를 가지고 있습니다: AI 에이전트는 Pod이 아니며 유용한 진보는 작업에 의존합니다. 이룰 수 있는 교훈은 좁습니다. 한 가지 모호한 녹색이나 빨간 신호가 모든 개입을 승인하지 않도록 하십시오. 적극적인 회복을 위해, 이 조치에 제한을 첨부하십시오: 한 번의 재실험이 아니라 무한한 재실험 루프 최대 기간과 비용 되돌릴 수 있는 단계 파괴적 또는 외부 행위에 대한 명시적인 승인 경계는; 진행 또는 결과에 대한 시사 후 검사. 지휘 완료는 회복이 아닙니다. 예상되는 상태가 바뀌면만 사건을 정리할 수 있습니다. 계약의 도구가 아니라 모든 생각 컴팩트된 정상화된 건강 기록은 기존의 추적 데이터 옆에 자리잡을 수 있습니다. 증거 참조를 접근 통제하고 비밀, 명령어, 원료 도구 사용량 및 엄격하게 요구되지 않는 한 절대적인 로컬 경로를 편집하십시오. 건강기록은 검사된 내용과 허가된 사업자가 검사할 수 있는 장소가 표시되어야 하며, 민감한 텔레메트리의 두 번째 복사본이 되어서는 안 됩니다. 4번 버전은 명확하게: 1. 증거를 정상화한 실행시간 어댑터 2. 진전 정의 3. 결과 predicate; 4. 분류기 규칙과 임계값. 그런 버전이 없다면, 변경된 테스트 명령어 또는 이름이 변경된 배달품은 갑자기 에이전트 회귀처럼 보일 수 있습니다. 이 방법의 끝을 알 수 있습니다. 어려운 부분은 또 다른 스탠을 모으지 않는 것입니다. 그것은 유익한 발전과 약속된 결과를 정직하게 정의하고 있습니다. 어떤 작업들은 일조적인 진행 측정이 없습니다. 연구 에이전트는 약한 가설을 버리고 이전 단계로 돌아갈 수 있습니다. 카운터가 떨어지는 경우에도 불구하고 그것은 귀중한 작업이 될 수 있습니다. 어떤 의존성들은 신뢰할 수 있는 유한 시간을 드러내지 못한다. 어떤 결과들은 검증금보다는 판단이 필요합니다. 그런 경우에는 증거를 보존하고 uncertain 를 보고하십시오. 보편적인 건강 점수를 가지고 정확성을 제조하지 마십시오. 또한 온라인 건강 검사를 오프라인 평가에서 분리합니다. 오프라인 데이터 집합은 새로운 에이전트 버전이 알려진 경우에 대해 더 정확하는지 여부를 나타낼 수 있습니다. 라이브 건강 창은 다른 질문에 답합니다. 이 특정 경기가 도달 가능하고, 움직이고, 합법적으로 기다리고 있거나 그 결과를 놓치고 있습니까? 보통 둘 다 필요해요 하나의 결과적인 작업 흐름으로 시작하세요. 하나의 진보 델타와 하나의 결정적 결과 기호를 정의하십시오. 알려진 작업, 기다림, 갇힌, 도달할 수 없는, 그리고 거짓 성공 사례를 재생합니다. 분류가 현실과 일치한 후에야 알림이나 제한된 복구 작업이 그것들에 따라 달라질 수 있다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 공공 사이트와 기사 시스템은 실시간이지만 생산 에이전트 건강 수집, 런타임 어댑터 및 복구 일반적으로 배송되지 않습니다. 제품 방향은 증거, 신선함, 신뢰 및 승인 경계를 대체하지 않고 더 쉽게 행동 할 수있는 건강 층입니다. 주요 참조 오픈텔레미트리: GenAI 에이전트 및 프레임워크 범위에 대한 의미 협약 은 2026년 7월 24일 발매되었습니다. 문서 상태: 개발. 클로드 코드: 모니터링 공식 텔레메트리 필드 및 구성, 2026년 7월 24일에 가져왔습니다. 쿠버네테스: 활력, 준비, 시작 탐사 공식 탐사 목적 및 복구 경고, 2026년 7월 24일