2026-07-31T20:59:04.966Z
Splunk LLM 관찰성: 평가자 호출을 에이전트 건강에서 제외하십시오
스플랭크 평가자 격리, 히스토그램 텔레메트리, 샘플링 커버리, 카드널리티, 컨텐츠 캡처 및 결과 증거에 신뢰하기 전에
Splunk LLM 관측 가능성은 유리한 성능, 품질, 토큰, 추정 비용, 그리고 기기된 에이전트에 대한 추적 증거를 보여줄 수 있습니다. 그러나 안전한 운영 기본값은 AI 에이전트 페이지가 채집되어 있지 않기 때문에 에이전트가 건강합니다. 먼저 측정 파이프라인이 완료되었음을 증명하고, 평가자 호출이 응용 작업으로 간주되지 않았다는 것을 증명하고, 평가 커버리는 알려진 지명자를 가지고 있으며, 요청된 결과는 추적 외부에 존재한다는 것을 증명합니다. 이 가이드에서는 그 증거를 수집하거나 응답하지 않고 구축합니다. 포함된 8개의 경우 포함된 8개의 경우 포함되지 않은 수신을 생성하고 각 노선은 다음 각 국가 중 하나로 이동합니다: 섭취가 불완전, 메트릭 계약 부합, 평가자가 스스로 관찰한, 고카디널리티 위험, 내용 정책 검토, 평가 커버리가 떨어졌거나, 관찰할 수 있지만 검증되지 않았거나, 검증되고 검증된 증거로 건강합니다. 점수를 읽기 전에 측정 경로를 감사하십시오. 스플랭크의 현재 설치 문서들은 두 개의 텔레메트리 세부사항이 운영적으로 중요하게 만듭니다. 첫째, AI 에이전트 모니터링 페이지에 히스토그램 매트릭이 필요합니다. 시그널Fx 수출자를 사용하는 경우, 문서화된 수집기 설정은 send otlp histograms: true 입니다. 설치는 또한 다음과 같이 델타 시간성을 지정합니다. 눈에 보이는 흔적은 이 측정 경로가 옳다는 것을 증명하지 않습니다. 스펜과 히스토그램은 독립적으로 실패할 수 있습니다. 둘째, 파이썬 AI 도구는 응용 프로그램과 동일한 프로세스에서 평가 작업을 수행 할 수 있습니다. Splunk는 이 스위치를 문서화합니다. 이 기본 모드에서는 DeepEval과 같은 평가자들에 의한 LLM 호출이 애플리케이션 호출과 함께 도구로 사용될 수 있습니다. OpenTelemetry SDK를 비활성화한 상태에서 자식 프로세스에서 True Run 평가로 설정하여 평가자의 호출이 애플리케이션 텔레메트리를 오염시키는 것을 방지합니다. Splunk은 다른 문서화된 프레임워크에 대한 평가가 가능하고 선택적으로 가능할 때 OpenAI 기기용에 필요한 이 격리를 표시합니다. 그 구별은 차트의 의미를 변화시킵니다. 한 에이전트 호출이 모델을 두 번 호출한다고 가정해보면, 한 평가자가 3번 더 모델을 호출합니다. 평가자가 도구화된 프로세스를 공유하면 순진한 집합은 다섯 번의 호출, 그들의 결합 토큰 및 그들의 결합 지연을 보고할 수 있습니다. 추가적인 활동은 실제 계산이지만, 요원이 더 많은 진전을 이루었다는 증거는 아닙니다. 측정 작업은 측정 작업을 관찰하는 측정 작업입니다. 배포에 대한 내용 없는 영수증을 기록합니다. 이 필드 중 어느 것도 프롬프트, 응답, 도구 논쟁, 비밀 또는 고객 식별자가 필요하지 않습니다. 그들은 증거 파이프라인의 건강을 설명합니다. 첫 번째 세 가지 검사는 다른 질문에 답합니다. histogramsExported : 수집자는 AI 모니터링 페이지에서 요구되는 히스토그램 텔레메트리를 수출했습니까? deltaTemporality : 매트릭 계약은 문서화된 구성과 일치합니까? aiSpanVisible : 적어도 한 번의 새로운 GenAI 랜드는 예상되는 Splunk 뷰에 도달했습니까? 이것들을 한 telemetry ok 볼리언으로 쪼개지 마십시오. 만약 스펜이 도착하지만 히스토그램이 도착하지 않는다면, 추종판이 불완전한 상태에서 추적 조사가 작동할 수 있습니다. 데이터가 오래된 경우, 채집된 페이지가 여전히 노후화 될 수 있습니다. 실제 실행에서 증거 소스와 관찰 시간을 수신과 함께 보관하십시오. 각 품질 점수를 커버리지 지칭을 부여합니다. 스플랭크는 AI 에이전트 품질 점수를 측정값에 합격한 평가의 비율로 설명합니다. AI 에이전트 문서에 따르면 그 점수를 계산하기 위해 랜프가 샘플링되며 80% 이하의 점수는 품질 문제가 있음을 나타냅니다. 그것은 평가된 샘플에 유용한 규칙이 될 수 있습니다. 이는 그 자체로 모든 지원 가능한 호출이 평가되었거나 샘플은 모든 작업 유형을 나타낸다는 증거가 아닙니다. 4개의 숫자를 추적해 보세요. 1. 지원할 수 있는 지원 기간 2. 구성된 평가 샘플 비율 3. 완료된 평가 결과는 4. 평가줄이 떨어집니다. 결정적인 감사 창에 대해, 계산: 400개의 적당한 기간, 0.25개의 샘플 비율, 100개의 평가 및 0개의 하락으로, 관찰된 커버리는 25%이며 구성된 기대에 부합한다. Znot 는 나머지 300개의 스탠이 지나갔다는 뜻입니다. 이는 그들의 평가 상태가 표본이 아닌 것을 의미합니다. Splunk의 파이썬 구성은 또한 평가 줄을 크기를 노출합니다. 긍정적 인 랜딩은 반압을 적용합니다. 줄이 가득하면 새로운 항목이 경고로 떨어집니다. 문서에서는 처리량과 메모리에 따라 1001000 범위의 한계를 권장하고 있으며, 0 또는 unset은 줄을 무제한으로 만듭니다. 두 선택의 어느 쪽에도 타협이 있습니다. 무제한 행렬은 평가 지연을 메모리 압력으로 변환시킬 수 있습니다. 제한된 줄을 따라서는 프로세스를 보존할 수 있지만 평가 커버링을 줄일 수 있습니다. 6개의 순차차적 인 계산기는 94개의 완료된 평가들이 100%의 표본률로 100개의 지원 가능한 평가들을 위해 정직하게 대립할 수 없다는 것을 의미합니다. 따라서 감사는 EVALUATION COVERAGE DROPPED 를 반환합니다. 건강하지 않고 실패한 요인이 아닙니다. 에이전트가 유용한 일을 완료했을 수도 있고, 질의 판결에 필요한 증거는 불완전하다. 메트릭 차원은 비슷한 경계를 필요로 합니다. 스플렁크는 GenAI 컨텍스트 속성을 메트릭 차원으로 복사할 수 있지만, gen ai.conversation.id 는 고카디널리티 문제를 일으킬 수 있다고 명시적으로 경고합니다. 진단에 필요한 경우 대화 당의 아이덴티티를 팽창으로 유지하십시오. 자동으로 메트릭 차원으로 변환하지 마십시오. 낮은 카디널리티 배포 환경이나 임차층은 일반적으로 집합에 더 안전하다; 올바른 집합은 여전히 교통 및 임차 제한에 달려 있습니다. 콘텐츠를 캡처하여 명시적인 예외를 유지하십시오 스플랭크의 LLM 서비스 문서에 따르면 프롬프트 및 응답 수집은 기본적으로 차단되어 있으며 콘텐츠는 민감하거나 식별할 수 있는 정보를 포함할 수 있다고 경고합니다. 설정 경로는 또한 큰 캡처된 입력과 출력이 백엔드 한계를 초과하고 성능 문제를 일으킬 수 있다는 것을 지적합니다. 이 감사는 내용의 필요성이 없습니다. 그것은 히스토그램 수출, 시간성, 프로세스 고립, 샘플링, 드롭, 크기와 추적 가시성, 그리고 메타데이터만을 사용하여 목적지 영수증을 확인할 수 있습니다. 개별적인 품질 조사에 대해 실제로 캡처 된 내용이 필요하다면, 콘텐츠 정책 검토를 통해 그것을 전달하십시오. 콘텐츠가 필요한 정확한 평가자를 식별한다. 포착이 , 사건 또는 둘 다에서 발생하는지 여부를 명시합니다. 문서 보관, 접근, 마스킹 및 삭제 시험용 부하 크기의 동작 도구 정의가 메시지의 캡처가 활성화되었기 때문에 캡처되지 않는다는 것을 확인합니다. 제한된 조사 후 계속적인 수집이 정당화되지 않는 경우 포획을 비활성화합니다. 장치는 CONTENT POLICY REVIEW 를 승인 인증을 받지 않고 캡처가 가능하면 반환합니다. 그 판결은 의도적으로 건전하거나 깨지지 않습니다. 이 장비는 운영 건강 검사가 승인할 수 없는 데이터 경계를 넘었다고 합니다. 같은 제한은 예상 비용에도 적용된다. 스플랭크는 그 에이전트 비용 추정은 공개된 제공자의 비용을 사용 가능한 토큰 수량으로 곱하고 실제 결제를 나타내지 않는다고 명시하고 있습니다. 추정된 라벨을 붙이고, 가격 날짜를 보관하고, 청구서 또는 공급자별 캐시 할인과 침묵으로 조화하지 마십시오. 8건의 증거조사를 실시 재현 가능한 유물은 우선순위 법칙을 사용합니다. 이전 발견은 나중에 녹색 상태를 차단합니다. 저장된 설치를 실행하세요: 8개의 사례를 재검토하고 8개의 다른 결과를 나타냅니다. 덮여 검증된 HEALTHY COVERED VERIFIED : 요구되는 텔레메트리, 선언된 샘플, 제로 드롭 및 결과 합의. 평가자격 관찰 EVALUATOR SELF OBSERVED : 판사 호출은 응용 프로그램 텔레메트리를 입력할 수 있습니다. histograms missing INGESTION INCOMPLETE : 추적은 필요한 매트릭스가 도착한 것을 증명하지 않습니다. X 잘못된 시간 METRIC CONTRACT MISMATCH : 수출된 메트릭 계약은 문서화된 설정과 다르다. 대화 ID as metric HIGH CARDINALITY RISK : 대화당 정체성은 메트릭 차원으로 촉진되었습니다. 콘텐츠 캡처 검토되지 않은 CONTENT POLICY REVIEW : 민감한 데이터 경계가 영수권 없이 넘겼다. 평가 계열에서 떨어지는 EVALUATION COVERAGE DROPPED : 94 결과는 예상 100을 나타낼 수 없습니다. Ztrace without outcome OBSERVABLE NOT VERIFIED : 실행 증거는 있지만 약속된 결과는 없습니다. 이것은 합성 구성 감사입니다. 실시간 Splunk의 적합성 테스트가 아닙니다. 그것은 수집자가 도달할 수 있다는 것을 증명할 수 없거나, 역할은 필요한 능력을 포함하고, 저장은 사고 창을 덮거나, 목적지는 예상되는 전달되는 것을 포함합니다. 고정값을 환경에서의 관찰으로 교체하고 값을 측정할 수 없는 경우 unknown 를 보존하십시오. 건강 판결 전에 추적을 중지 스플랭크의 추적 및 AI 상호 작용 조치는 모델 운영, 오류, 토큰 사용, 지연 및 평가 된 응답 품질에 대한 중요한 질문에 대답합니다. 에이전트 건강 판결은 한 가지 더 제한적이 있습니다. 요청된 작업이 이루어졌습니까? 사용 가능한 가장 강력한 결정적 목적지 확인을 선택하십시오: 파일은 예상 경로에서 존재하고 스케마 또는 해시와 일치합니다. 예상된 저장소에서 pull 요청이 존재하고, 의도된 목적지에서 예상되는 무력성 키가 있는 메시지가 존재합니다. 계획된 임차자 및 운영 아이디에 데이터베이스 돌연변이가 표시됩니다. 생산된 유물에 대한 시험 부합이 통과되는 경우 아직 인력 승인을 받지 못하고 있어, waiting 로 실행됐고, 실패하지 않았습니다. 영수증을 추적할 수 있는 정보로 연결해 주세요. 전달가능한 내용을 원천에서 보관하십시오. 성공적인 기간과 결실된 영수증은 OBSERVABLE NOT VERIFIED 입니다. 다시 시도하는 것은 자동적인 권한이 아니기 때문에 외부 효과는 존재할 수 있지만 일시적으로 읽을 수 없습니다. 실용적인 규칙은 간단합니다. 자신의 측정 경로가 지나면 Splunk 관점을 신뢰하고, 알려진 범위 내에서 품질 점수를 해석하고, 의도된 결과를 별도로 확인했을 때만 에이전트의 건강이 명확합니다. Sidewisp는 동일한 증거 첫 제품 방향을 따르고 있습니다: 활동과 유용한 진보를 구별하고, 부족한 증거를 노출하고, 결과 검증을 추적 완료에서 분리합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 생산 모니터링 어댑터와 복구 엔진은 일반적으로 사용할 수 있는 것으로 여기 소개되지 않습니다. 공공 사이트는 초기 접근 경험과 제품 시범입니다. 출처 AI 에이전트 모니터링을 설정, 스플랭크 관찰성 클라우드 문서화 AI 응용 프로그램 0.1.14 이상에 Python 에이전트를 구성, 스플랭크 관찰성 클라우드 문서화 AI 요인을 모니터링, 마지막으로 업데이트 된 2026년 6월 16일 LLM 서비스를 모니터링, 마지막으로 업데이트 된 2026년 5월 12일