2026-08-01T12:22:46.990Z
Grafana LLM 관찰 가능: 결과층을 증명한다
그래파나의 생성 및 오픈텔레메트리 경로를 구현하고, 에이전트를 건강하게 호출하기 전에 실행 시간, 대기, 효과 및 목적지 증거를 감사하십시오.
Grafana LLM 관측 가능성은 모델 호출, 에이전트 세대, 추적, 도구 활동, 지연, 토큰, 비용 및 평가에 대한 강력한 설명을 줄 수 있습니다. 그것은 그 자체로 에이전트가 기대할 때 도달할 수 있다는 것을 증명할 수 없으며, 적절한 사람을 기다렸거나, 외부 효과를 정확히 한 번 적용하거나, 요청된 결과물을 생산할 수 없다는 것을 증명할 수 없습니다. 따라서 실질적인 기본은 두 부분입니다. 그래파나를 사용하여 문서화한 텔레메트리, 그리고 텔레메트리가 답하지 않는 질문에 작은 운영 증거 계약을 추가합니다. 이 부분을 따로 테스트해 보세요. 그라파나에서 나온 대화는 흔적이 왔다는 증거가 아니며, 깨끗한 흔적이 목적지가 바뀌었다는 증거가 아닙니다. 이 가이드에서는 그 경계를 Grafana의 현재 문서와 @grafana/agento11y 자바스크립트 패키지에 적용합니다. 또한 7개의 사례에 대한 감사가 포함되어 있으며, 이를 통해 수락 규칙이 실행될 수 있는 것이 아니라 래시보드 조언으로 남겨집니다. 문서화된 경로를 시작해서 조각으로 테스트하세요 그라파나는 현재 두 개의 관련 노선을 공개하고 있습니다. 일반 AI 관찰성 설정는 기본적으로 Grafana Cloud OTLP 게이트웨이를 통해 OpenTelemetry 추적, 매트릭 및 로그를 전송합니다. 더 큰 볼륨에서 라우팅, 변환 또는 더 나은 제어가 필요할 때 OpenTelemetry 컬렉터 또는 Grafana 알로이지는 문서화 된 대안입니다. 새로운 요원 관찰성 표면은 에이전트 지향적인 세대, 대화, 도구 호출, 작업 흐름 단계, 토큰 및 비용 데이터, 평가 및 프레임워크 통합을 추가합니다. 자바스크립트에서, 현재 패키지는 @grafana/agento11y 입니다. npm latest 태그는 2026년 7월 27일에 확인되었을 때 버전 0.9.0 를 반환했습니다. 영구적인 버전 추천이 아닌 날짜가 된 구현 스냅샷으로 취급하십시오. 가장 짧은 기록된 시작은 다음과 같습니다. 그러면 SDK를 원천에 액세스 토큰을 넣기보다는 환경 변수에서 구성합니다. 관련 환경 변수의 이름은 AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID , AGENTO11Y AUTH TOKEN 로 문서화된다. 로그에 그 값을 인쇄하거나 흔적에 붙이지 마십시오. Grafana의 자바스크립트 도구 가이드에는 쉽게 놓칠 수 있는 한계가 있습니다. SDK는 생성 데이터를 전송할 수 있지만, 전송되는 범위와 매트릭을 수출하기 위해 응용 프로그램으로 구성된 TracerProvider 및 MeterProvider 가 필요합니다. 그 공급자가 없으면 가이드는 흔적과 매트릭이 조용히 사라졌다고 말합니다. 그래서 하나의 대화가 눈에 띄는 것은 약한 설정 테스트가 됩니다. 대신 3개의 독립적인 탐사선을 사용하세요. 1. 고유의 테스트 ID를 가진 세대를 생성하고 Conversations 에서 찾아보십시오. 2. 흔적 데이터 소스에서 동일한 상관관계 ID를 가진 스랜을 찾으십시오. 3. 테스트 창에서 SDK에서 발행된 한 메트릭을 검색하고 그 리소스 속성을 확인하여 예상되는 서비스와 환경을 식별합니다. 탐사선이 빠진 경우 설정 실패. 이 세 가지 점수를 편안한 점수로 평균하지 마십시오. generation=yes, trace=no, metric=no 는 부분적인 텔레메트리입니다. 대부분 건강한 설치가 아닙니다. 그래파나 흔적은 여전히 활동 증거입니다. 그라파나 문서가 유용한 커버리지를 기록합니다. 에이전트 관찰성 (Agent Observability) 는 세대, 도구 호출, 작업 흐름 단계, 지연, 오류, 토큰, 비용, 품질 점수 및 버전 비교를 캡처 할 수 있습니다. 그 신호는 다음과 같은 질문에 답할 수 있습니다. LLM 전화가 실패했나요? 어떤 모델과 에이전트 버전이 도망를 처리했나요? 어떤 도구가 사용 되었으며 어떤 흔적 으로 사용 되었습니까? 얼마나 많은 토큰과 얼마나 많은 비용으로 실행이 소비되었습니까? 구성된 평가나 경비에서 점수를 얻었나요? OpenTelemetry GenAI 에이전트 컨벤션는 그 활동에 휴대용 어휘를 제공합니다. 연구 당시, 에이전트 컨벤션은 개발 상태를 명시적으로 표시하고 에이전트 또는 작업 흐름을 호출하는 작업, 기획 및 도구를 실행하는 작업을 포함했습니다. 개발 상태가 중요합니다: 기기 버전을 정지하고 속성이나 스팸 모양이 진화하기를 기대합니다. 그 이름들 중 어느 것도 당신의 비즈니스 결과를 정의하지 않습니다. execute tool 기간은 제공자가 요청을 비동기적으로 적용하거나 검증 후 거부하거나 잘못된 객체에 작성하는 동안 성공적인 HTTP 응답을 보고할 수 있습니다. 완료된 워크플로우 기간은 실종된 파일과 공존할 수 있습니다. 품질 평가는 생성된 텍스트를 점수할 수 있지만, 예정된 실행은 시작되지 않습니다. 증거와 그 경계를 나타내는 증거 지도를 사용하십시오. 증거 비행기 그것은 확립 할 수 있습니다 이 법은 방출 탐사선 생산 수출 기록된 모델 세대는 에이전트 관찰성을 달성했습니다. 흔적과 측정값이 수출되었습니다. 독특한 대화 ID를 찾으세요 흔적 기기적인 운영과 그 원인 경로 외부 목적지는 이제 의도된 상태를 가지고 있습니다. 관련 기간에 대한 질문 매트릭스 집계된 비율, 기간, 오류, 토큰 및 비용 신호 필요한 한 번의 실행 또는 배달이 성공했습니다. 정확한 테스트 창을 검색 평가 명칭의 득점자는 공급된 자료에 대항하여 달려갔다. 결정적인 목적지 주장이 통과 스코어 버젼 및 입력 범위를 유지 운행시간 영수증 실행 시간은 예상 시간에 도달 가능하고 신선했습니다 완료된 작업 심장 박동 연령과 SLA를 비교해 보세요. 영수증을 기다립니다 휴식에는 이유, 소유자, 임대 및 재개 작업이 있습니다. 주인이 시간에 결정할 거야 라우팅 및 에스컬레이션을 확인 실적 인수 외부 작업은 조정될 수 있습니다. 사용자의 전체 결과는 현재 있습니다. 안정적인 동작 ID를 통해 다시 읽어보세요 결과 인수 목적지별 진술이 통과 미래 안정성 안정성 창에서 다시 확인 이것은 더 많은 콘텐츠를 업로드하는 데 대한 주장이 아닙니다. ID, 시간표, 버전, 낮은 카디널리티 상태, 해시, 카운트 및 목적지 주장을 원료 명령어, 완료, 도구 유용 부하, 비밀 또는 파일 경로보다 선호합니다. 풍부한 텔레메트리 및 데이터 최소화는 기기 제작 전에 계약이 설계될 때 호환된다. 7개의 사례에 대한 보급감사를 실시 저는 지도를 작은 결정적 장치로 변환했습니다. 각 사례는 생성, 추적 및 측정 수출이 성공했는지, 텔레메트리와 런타임 심장 박동이 신선했는지, 런트는 합법적인 대기 여부를 기록하고, 외부 효과가 조화되었는지, 예상된 결과는 권위있는 수신 여부를 기록합니다. 분류자는 수학적보다는 우선순위를 적용한다. 7개의 장치는 다음과 같습니다. 세대가 도착하지 않았습니다. 생산이 도착했지만, 기간과 측정은 도착하지 않았습니다. 모든 텔레메트리는 존재하지만 쓸모가 없습니다. 에이전트는 소유자와 함께 합법적으로 대기하고 있으며, 도구 시도는 조화 효과를 받지 않습니다. 텔레메트리 및 도구 증거는 녹색이지만 전달 가능한 것은 없어집니다. 같은 작성된 케이스에는 공인 배달 영수증이 있습니다. 지역 리플레이는 예상되는 7가지 분류를 통과했습니다. 가장 유용한 비교는 마지막 두 가지 사례입니다. 둘 다 생성, 추적 및 측정 수출을 가지고 있습니다. 둘 다 신선해요 둘 다 실행이 완료되고 도구 효과가 확인된 것을 보고합니다. 첫 번째에는 목적지 주장이 없으며 false success 로 분류됩니다. 두 번째에는 object:report 17 + 콘텐츠 해시가 추가되어 verified 가됩니다. 그 변화는 의도적으로 좁습니다. 대시보드 패널, 토큰 카운트, 모델 스코어 또는 추적 상태 변경 사항이 없습니다. 사용자 요청에 의해 요구되는 증거만 변경됩니다. 감사는 한 가지 어려운 한계를 가지고 있습니다. 그것은 자신에게 제공된 사실들을 신뢰합니다. 악의적이거나 부실한 수집자는 거짓말을 할 수 있으며 잘못된 목적지에서 인증을 받는 것은 증거가 아닙니다. 생산에서 권한있는 경계에서 결과 영수증을 생성합니다. 저장소 읽기 후 쓰기, 데이터베이스 제약 질의, 배포 건강 탐사, 전송 메시지 제공자 검색 또는 원래 작업 ID에 연결된 다른 결정적 주장. 커버링을 생산 수용 게이트로 전환 새로운 에이전트 버전, 프레임워크 통합, 수집자 경로 또는 샘플링 변경을 활성화하기 전에 하나의 기기 캐너리를 실행하십시오. 카나리아에게 독특한 업무 인증을 주고, 유해한 결과를 기대할 수 있게 해줍니다. 다음으로 적용 가능한 모든 주장을 요구합니다. Generation: 이 세대는 카나리 ID 아래 존재합니다. Trace: 루트 스파드와 필요한 자식 동작은 검색할 수 있습니다. Metric: 카나리 창은 예상되는 시리즈에 기여합니다. Freshness: 컬렉터 지연은 선언된 한계 이하로 유지됩니다. Runtime: 심장 박동 또는 스케줄러 인수증은 예상할 때 실행 시간을 달성할 수 있었다는 것을 증명합니다. 기다림: 모든 일시 중단은 그 이유, 허가 된 소유자, 결정의 마지막 날짜, 승강 경로 및 재개 핸들 이름을 지정합니다. E 효과: 부작용 작업은 안정적인 무력 또는 공급자 운영 ID에 맞게 조정됩니다. O 출력: 권위 있는 목적지 확인은 요청된 유물 또는 상태가 존재한다는 것을 증명합니다. 보호: 테스트 쿼리는 금지된 프롬프트, 응답, 비밀 및 경로 필드가 없는 것을 확인합니다. 유죄 판결을 편리하게 하지 마세요. telemetry partial 는 기기 배치를 차단해야 합니다. health unknown 는 증거가 구석이 될 때 녹색 상태를 방지해야 합니다. waiting 는 합법적인 작업을 다시 시작하지 않고 소유자에게 알려야 합니다. uncertain effect 은 맹목적인 재시험을 중단해야 합니다. false success 는 추적이 정상적으로 종료되었을 때에도 작업이나 사고를 다시 열어야 합니다. 샘플링은 별도의 결정이 필요합니다. 부피가 요구할 때 무거운 흔적을 샘플링할 수 있지만, 필요한 경주 경주를 분류하기 위해 필요한 컴팩트 건강 인증을 함께 사라져서는 안 된다. 샘플링 된 흔적과 샘플링되지 않은 실행, 대기, 효과 및 결과 수신과 상관관계를 갖도록 충분한 식별자를 보관하십시오. 그렇지 않으면 더 저렴한 텔레메트리 정책은 조용히 더 약한 정확성 정책으로 변합니다. 또한 운영 비용도 있습니다. 목적지 리드백은 지연과 제공자 호출을 추가합니다. 런타임 심장 박동은 저장 및 신선성 검사를 추가합니다. 대기 영수증은 라우팅 소유권이 필요합니다. 결정을 해결하는 가장 작은 결정적 검사를 적용하십시오. 파일의 존재와 해시 확인은 다른 모델에게 파일이 존재할 가능성이 있는지 묻는 것보다 낫습니다. LLM 판사는 결과물이 의미적일 때 유용하지만, 결정적 검사와 함께 그 버전, 주식, 입력 범위 및 불확실성을 기록합니다. Sidewisp가 들어맞는 곳 그라파나는 텔레메트리를 검사하고 연결할 수 있는 좋은 장소입니다. 여기서 설명된 실종층은 접근성, 진전, 기다림, 효과 및 결과에 대한 운영 판단입니다. Sidewisp는 기존의 에이전트 런타임에 대한 건강 계층이 될 것으로 의도되며, 명시적인 증거, 신선함, 불확실성, 승인 경계가 있으며 검증됩니다. 대체 실행시간이나 의무적인 모델 게이트웨이는 아닙니다. 생산 모니터링 어댑터와 복구 프로그램은 오늘 배송되지 않습니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 이 증거 경계는 당신이 에이전트를 어떻게 운영하는지 일치한다면 적절한 다음 단계는 개인 미리보기 대기 목록에 가입하고 당신이 필요로 하는 실행 시간 및 결과 검사를 설명하는 것입니다. 그 때까지, 그라파나의 텔레메트리 판정을 정확하게 유지하고 목적지에 완료된 것을 연결해두고 당신의 작업이 실제로 필요로 하는 증거.