2026-07-31T20:58:24.428Z
Splunk LLM Observabilidade: Mantenha as chamadas do avaliador fora da saúde do agente
Audit Splunk isolamento do avaliador, telemetria do histograma, cobertura de amostragem, cardinalidade, captura de conteúdo e prova de resultados antes de confiar em uma visão de agente verde.
A observabilidade do Splunk LLM pode mostrar um desempenho útil, qualidade, token, custo estimado e evidências de rastreamento para um agente instrumentado. O padrão operacional seguro, no entanto, não é a página AI Agents está preenchida, portanto, o agente é saudável. Primeiro provar que o pipeline de medição está completo, que as chamadas de avaliador não estão sendo contadas como trabalho de aplicação, que a cobertura de avaliação tem um denominador conhecido e que o resultado solicitado existe fora do rastro. Este guia constrói essa prova sem coletar pedidos ou respostas. A fixação de oito casos incluída produz um recibo livre de conteúdo e as rotas cada um dirigem se a um destes estados: ingestão incompleta, desajuste de contrato métrico, auto observado pelo avaliador, risco de alta cardinalidade, revisão da política de conteúdo, cobertura de avaliação reduzida, observável mas não verificada, ou saudável com evidências cobertas e verificadas. Auditar o caminho de medição antes de ler a pontuação A documentação de configuração atual do Splunk torna dois detalhes de telemetria operacionalmente importantes. Em primeiro lugar, são necessárias métricas de histograma para as páginas de Monitoramento do Agente AI. Quando for utilizado o exportador SignalFx, a configuração do coletor documentado é send otlp histograms: true . A configuração também especifica a temporalidade delta através de: Um rastro visível não prova que este caminho métrico seja correto: os intervalos e histogramas podem falhar de forma independente. Em segundo lugar, a instrumentação Python AI pode executar avaliações no mesmo processo que a aplicação. O Splunk documenta este interruptor, cujo padrão é falso: Nesse modo padrão, as chamadas LLM efectuadas por avaliadores como o DeepEval podem ser instrumentalizadas ao lado das chamadas de aplicação. Configurar as avaliações de execução em um processo infantil com o SDK OpenTelemetry desativado, impedindo que as chamadas dos avaliadores poluam a telemetria das aplicações. O Splunk marca esse isolamento como necessário para a instrumentação OpenAI quando as avaliações são habilitadas e opcionais para outros quadros documentados. Essa distinção muda o significado de um gráfico. Suponha que uma invocação de agente ligue um modelo duas vezes, então um avaliador faz mais três chamadas de modelo. Se o avaliador compartilhar o processo instrumentado, um agregado ingênuo pode relatar cinco chamadas, seus tokens combinados e sua latência combinada. A atividade extra é real, mas não é evidência de que o agente tenha feito mais progressos. É um trabalho de medição que observa o trabalho de medição. Registrar um recibo livre de conteúdo por implantação: Nenhum desses campos precisa de um prompt, resposta, argumento de ferramenta, segredo ou identificador de cliente. Eles descrevem a saúde do pipeline de evidências. As três primeiras verificações respondem a perguntas diferentes: histogramsExported : Exporta o coletor a telemetria do histograma exigida pelas páginas de monitoramento AI? deltaTemporality : o contrato de métricas corresponde à configuração documentada? aiSpanVisible : Atinge pelo menos um novo período de GenAI a visão esperada do Splunk? Não colapse estes em um telemetry ok boolean. Se os intervalos chegarem, mas os histogramas não, a investigação de rastreamento pode funcionar enquanto os painéis agregados permanecem incompletos. Se os dados forem antigos, uma página povoada ainda pode estar obsoleta. Mantenha a fonte de provas e o tempo de observação ao lado do recibo numa execução real. Dê a cada pontuação de qualidade um denominador de cobertura O Splunk descreve uma pontuação de qualidade do agente AI como a porcentagem de avaliações que foram aprovadas para uma métrica. A sua documentação AI Agents diz que os intervalos são tomados para calcular essas pontuações, e uma pontuação abaixo de 80% indica um problema de qualidade. Essa pode ser uma regra útil para a amostra avaliada. Não é, por si só, prova de que todas as invocações elegíveis tenham sido avaliadas ou de que a amostra represente todos os tipos de tarefas. Rastrear quatro números juntos: 1. períodos de aplicação elegíveis; 2. taxa de amostragem de avaliação configurada; 3. Resultados completos da avaliação; 4. A fila de avaliação diminui. Para uma janela de auditoria determinista, calcular: Com 400 intervalos elegíveis, uma taxa de amostragem de 0,25, 100 avaliações e zero quedas, a cobertura observada é de 25% e corresponde à expectativa configurada. Isso significa que Znot os outros 300 espaços passaram. Significa que o seu estado de avaliação está fora da amostra. A configuração Python do Splunk também expõe um tamanho de fila de avaliação. Um limite positivo aplica pressão de volta; quando a fila está cheia, novos itens são lançados com um aviso. A documentação recomenda um limite na faixa de 1001000 dependendo da capacidade e da memória, enquanto o zero ou o unset deixa a fila ilimitada. Qualquer escolha tem um compromisso: Uma fila ilimitada pode transformar o atraso de avaliação em pressão de memória; Uma fila limitada pode preservar o processo, mas reduzir a cobertura da avaliação; Um contador de queda na fila de seis significa que 94 avaliações concluídas não podem honestamente substituir 100 avaliações elegíveis a uma taxa de amostragem de 100%. A auditoria, portanto, retorna a EVALUATION COVERAGE DROPPED , não saudável e não agente falhado. O agente pode ter concluído um trabalho útil; as provas necessárias para o veredicto de qualidade são incompletas. As dimensões métricas precisam de um limite semelhante. O Splunk permite que os atributos de contexto da GenAI sejam copiados em dimensões métricas, mas adverte explicitamente que o gen ai.conversation.id pode causar problemas de alta cardinalidade. Mantenha a identidade por conversa em intervalos quando for necessário para o diagnóstico. Não o converta automaticamente numa dimensão métrica. Um ambiente de implantação de baixa cardinalidade ou nível de inquilinos é geralmente mais seguro para a agregação; o conjunto correto ainda depende dos limites de tráfego e inquilinos. Mantenha o conteúdo capturar uma exceção explícita A documentação do serviço LLM do Splunk diz que a coleta de resposta e de resposta é desativada por padrão e avisa que o conteúdo pode conter informações sensíveis ou de identificação pessoal. O seu caminho de configuração também observa que grandes entradas e saídas capturadas podem exceder os limites do backend e causar problemas de desempenho. Esta auditoria não necessita de conteúdo. Pode verificar a exportação do histograma, a temporalidade, o isolamento do processo, a amostragem, as quedas, as dimensões, a visibilidade dos vestígios e o recibo de destino utilizando apenas metadados. Se uma investigação de qualidade separada realmente exigir o conteúdo capturado, encaminhá lo através de uma revisão da política de conteúdo: Identificar o avaliador exato que necessita de conteúdo; indicar se a captura ocorre em intervalos, eventos ou ambos; A retenção, o acesso, a ocultação e a exclusão dos documentos; comportamento de ensaio de tamanho da carga útil; Verificar que as definições de ferramentas não são capturadas apenas porque a captura de mensagens foi habilitada; desativar a captura após a investigação limitada se não for justificada a recolha contínua. O dispositivo retorna o CONTENT POLICY REVIEW quando a captura é habilitada sem um recibo de aprovação. Esse veredicto é deliberadamente nem saudável nem quebrado. Diz que a instrumentação atravessou um limite de dados que o controlo de saúde operacional não pode autorizar. A mesma restrição aplica se ao custo estimado. A Splunk afirma que a sua estimativa de custos de agente multiplica o custo do fornecedor publicado por contabilização de tokens disponíveis e não representa a faturamento real. Marcar a estimativa, conservar a data de fixação dos preços e não conciliá la silenciosamente com uma fatura ou um desconto em cache específico do fornecedor. Realizar a auditoria das provas em oito casos O artefato reprodutivel usa uma regra de prioridade. Descobertas anteriores bloqueiam estados verdes posteriores: Execute o dispositivo guardado: Repete oito casos e retorna oito resultados distintos: coberto e verificado HEALTHY COVERED VERIFIED : Telemetria necessária, amostra declarada, quedas zero e acordo de resultados. evaluador auto observado EVALUATOR SELF OBSERVED : As chamadas de juízes podem entrar na telemetria de aplicação. histogramas faltantes INGESTION INCOMPLETE : Um rastro não prova a chegada das métricas necessárias. ZError temporalidade METRIC CONTRACT MISMATCH : O contrato métrico exportado difere da configuração documentada. conversão id as metric HIGH CARDINALITY RISK : A identidade por conversa foi promovida para uma dimensão métrica. content capture unreviewed CONTENT POLICY REVIEW : Um limite de dados sensíveis foi atravessado sem um recibo. Valuation queue dropped EVALUATION COVERAGE DROPPED : 94 resultados não podem representar uma expectativa de 100. trace without outcome OBSERVABLE NOT VERIFIED : Evidências de execução existem, mas o resultado prometido não. Isto é uma auditoria de configuração sintética, não um teste de conformidade ao vivo do Splunk. Não pode provar que um coletor é acessível, que um papel inclui a capacidade necessária, que a retenção abrange uma janela de incidente ou que um destino contém o produto esperado. Substituir os valores do dispositivo por observações do seu ambiente e preservar o unknown quando um valor não pode ser medido. Parem o rastro antes do veredicto de saúde . As visualizações de interação do Splunk e do AI respondem a perguntas importantes sobre operações do modelo, erros, uso de tokens, latência e qualidade de resposta avaliada. Um veredicto de agente saúde tem mais um limite: o trabalho solicitado foi feito? Escolha a verificação determinista de destino mais forte disponível: um arquivo existe no caminho esperado e corresponde a um esquema ou hash; Existe uma solicitação de retirada no repositório esperado e o compromisso; Existe uma mensagem no destino previsto com a chave de idempotença prevista; Uma mutação da base de dados é visível sob a identificação do inquilino e da operação prevista; Uma série de ensaios aprovada contra o artefato produzido; A aprovação humana ainda está pendente, por isso a corrida é waiting , não falhou. Junte esse recibo ao rastreamento com um identificador de privacidade mínimo. Mantenha o conteúdo entregue na sua fonte. Um período de sucesso mais um recibo faltante é OBSERVABLE NOT VERIFIED ; não é uma permissão automática para tentar novamente, porque o efeito externo pode existir, mas ser temporariamente ilegível. A regra prática é simples: confiar na visão do Splunk após o seu próprio caminho de medição passar, interpretar as pontuações de qualidade dentro da sua cobertura conhecida e deixar claro a saúde do agente somente quando o resultado pretendido é verificado separadamente. A Sidewisp segue a mesma orientação do produto em primeiro lugar: distinguir a atividade do progresso útil, expor as evidências faltantes e manter a verificação dos resultados separada da conclusão do rastreamento. A Sidewisp está atualmente em prévia privada. Os seus adaptadores de monitorização de produção e o motor de recuperação não são apresentados aqui como disponíveis em geral; o local público é uma experiência de acesso precoce e uma demonstração de produtos. Fontes Configurar AI Agente de Monitorização, documentação da nuvem de observação Splunk. Configurar o agente Python para aplicações AI 0.1.14 e superiores, documentação da nuvem de observação Splunk. Monitorar os agentes AI, atualizado pela última vez em 16 de junho de 2026. Monitorar os serviços LLM, atualizado pela última vez em 12 de maio de 2026.