2026-08-01T12:22:41.551Z
Grafana LLM Observabilidade: Prova a camada de resultado
Implementar a geração de Grafana e os caminhos de OpenTelemetry, depois auditar o tempo de execução, espera, efeito e provas de destino antes de chamar um agente saudável.
Grafana LLM observabilidade pode dar lhe uma conta forte de chamadas de modelo, gerações de agentes, vestígios, atividade da ferramenta, latência, tokens, custo e avaliações. Não pode, por si só, provar que um agente foi acessível quando esperado, esperou na pessoa certa, aplicou um efeito externo exatamente uma vez ou produziu o produto solicitado. O padrão prático é, portanto, de duas partes: utilizar Grafana para a telemetria que documenta, e depois adicionar um pequeno contrato de evidências operacionais para as perguntas que a telemetria não responde. Teste essas partes separadamente. Uma conversa que aparece em Grafana não é prova de que traços e métricas chegaram, e um rastro limpo não é prova de que o destino mudou. Este guia implementa esse limite contra a documentação atual da Grafana e o pacote JavaScript @grafana/agento11y . Inclui também uma auditoria de sete casos que torna a regra de aceitação executável, em vez de deixá la como conselho de painel. Comece com o caminho documentado, depois teste o em pedaços. Grafana expõe atualmente duas rotas relacionadas. O seu AI Configuração de observabilidade geral envia rastros, métricas e logs da OpenTelemetry através do gateway OTLP da Grafana Cloud por padrão; um coletor de OpenTelemetry ou Grafana Alloy é a alternativa documentada quando você precisa de roteamento, transformação ou melhor controle em volume maior. Sua nova superfície Observabilidade do agente adiciona gerações orientadas para agentes, conversas, chamadas de ferramentas, etapas de fluxo de trabalho, dados de tokens e custos, avaliações e integrações de framework. Para o JavaScript, o pacote atual é @grafana/agento11y . A tag npm latest devolveu a versão 0.9.0 quando verificada em 27 de julho de 2026. Trate isso como um instantâneo de implementação datado, não uma recomendação de versão permanente. O começo mais curto documentado parece assim: Em seguida, configure o SDK a partir de variáveis do ambiente em vez de colocar um token de acesso na fonte: Os nomes das variáveis ambientais relevantes são documentados como AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID e AGENTO11Y AUTH TOKEN . Não imprimir os seus valores em registros ou anexá los a vestígios. Há um limite fácil de perder no Guia de instrumentação JavaScript da Grafana: a exportação de geração e a exportação de OpenTelemetry não são o mesmo caminho. O SDK pode enviar dados de geração, mas precisa de um TracerProvider e MeterProvider configurados pela aplicação para exportar os intervalos e métricas que emite. Sem esses provedores, o guia diz que os vestígios e as métricas estão silenciosamente perdidos. Isso torna uma conversa visível um teste de configuração fraca. Use três sondas independentes em vez disso: 1. Criar uma geração com um ID de teste único e encontrá lo em Conversations . 2. Encontre um espaço que contenha a mesma identificação de correlação na fonte de dados dos vestígios. 3. Pergunte uma métrica emitida pelo SDK na janela de teste e confirme que os seus atributos de recurso identificam o serviço e o ambiente esperados. Falha na configuração se faltarem sondas. Não proporcione a média dos três em uma pontuação reconfortante: o generation=yes, trace=no, metric=no é uma telemetria parcial, não uma instalação em geral saudável. Um rastro completo de Grafana ainda é evidência de atividade Grafana documenta cobertura útil. A Agent Observability pode capturar gerações, chamadas de ferramentas, etapas de fluxo de trabalho, latência, erros, tokens, custos, pontuações de qualidade e comparações de versões. Esses sinais podem responder a perguntas como: A chamada LLM falhou ou desacelerou? Que modelo e versão de agente lidou com a fuga? Que ferramentas foram invocadas, e em que traço? Quantos tokens e quanto custo atribuído consumiu a corrida? Uma avaliação configurada ou um guarda produziu uma pontuação? O Convenções de agentes da OpenTelemetry GenAI dá a essa atividade um vocabulário portátil. No momento da pesquisa, as convenções de agentes foram explicitamente marcadas o status de desenvolvimento e incluíram operações para invocar um agente ou fluxo de trabalho, planejar e executar uma ferramenta. O estado de desenvolvimento é importante: fixa a versão de instrumentação e espera que os atributos ou as formas de intervalos evoluam. Nenhum desses nomes define o resultado do seu negócio. Um espaço de tempo execute tool pode relatar uma resposta HTTP bem sucedida enquanto o provedor aplica a solicitação de forma assíncrona, rejeita a após a validação ou escreve para o objeto errado. Um intervalo de fluxo de trabalho completo pode coexistir com um arquivo faltante. Uma avaliação de qualidade pode marcar o texto gerado enquanto uma execução programada nunca começou. Use um mapa de evidências que indique tanto a prova quanto a sua fronteira: Avião de prova Pode estabelecer Não estabelece Sonda de liberação Exportação de geração Uma geração de modelos gravada alcançou a Observabilidade do Agente Foram exportados traços e métricas Encontrar um ID de conversa única Traços Operações instrumentadas e seu caminho causal O destino externo agora tem o estado previsto Interrogar a intervalo correlacionado Métricas Indicações agregadas de taxa, duração, erro, token e custo Uma execução ou entrega requerida foi bem sucedida Pergunte a janela de teste exata Avaliação Um marcador nomeado correu contra o material fornecido Uma afirmação determinista de destino aprovada Reter a versão de pontuação e o âmbito de entrada Receita do horário de execução O tempo de execução foi acessível e fresco no tempo esperado A tarefa concluída Compare a idade do batimento cardíaco com a sua SLA Esperem o recibo . Uma pausa tem uma razão, proprietário, prazo e manuseio de retorno O dono decidirá a tempo . Verificar o roteamento e a escalada Receita de efeito Uma operação externa pode ser reconciliada O resultado completo do utilizador está presente Leia de volta por ID de operação estável Receita do resultado Uma afirmação específica do destino aprovada Estabilidade futura Reverificar durante uma janela de estabilidade Isto não é um argumento para carregar mais conteúdo. Preferir IDs, timestamps, versões, estados de baixa cardinalidade, hashes, contagens e afirmações de destino em relação a pedidos brutos, conclusões, cargas úteis de ferramentas, segredos ou caminhos de arquivo. A telemetria rica e a minimização dos dados são compatíveis quando o contrato é concebido antes da instrumentação. Realizar a auditoria de cobertura de sete casos Convertei o mapa em uma pequena fixação determinista. Cada caso registra se a geração, rastreamento e exportação métrica tiveram sucesso; se a telemetria e o batimento cardíaco no tempo de execução são frescos; se a corrida tem uma espera legítima; se um efeito externo foi reconciliado; e se o resultado esperado tem um recebimento autorizado. O classificador aplica a prioridade em vez de aritmética: Os sete aparelhos cobrem: nenhuma geração chegou; A geração chegou, mas os intervalos e as métricas não; Toda a telemetria existe, mas está ultrapassada; O agente está legitimamente à espera com um proprietário, prazo e token de retomada; Uma tentativa de ferramenta não tem recebimento de efeito reconciliado; As provas de telemetria e de ferramentas são verdes, mas o material de entrega está ausente; O mesmo caso preenchido tem um recibo de entrega autorizado. A repetição local superou as sete classificações esperadas: A comparação mais útil é entre os dois últimos casos. Ambos têm geração, rastreamento e exportação métrica. Ambos estão frescos. Ambos relatam a execução concluída e o efeito da ferramenta verificado. O primeiro não tem afirmação de destino e é classificado como false success ; o segundo adiciona object:report 17 mais um hash de conteúdo e se torna verified . Essa mudança é deliberadamente restrita. Nenhum painel do painel, contagem de tokens, pontuação do modelo ou mudanças no status de rastreamento. Apenas as provas exigidas pelo pedido do utilizador são alteradas. A auditoria tem uma dura limitação: confia nos factos que lhe foram fornecidos. Um colecionador malicioso ou quebrado pode mentir, e um recibo do destino errado não é prova. Na produção, gerar recibos de resultados na fronteira autorizada: uma leitura de armazenamento após a escrita, uma consulta de restrição de banco de dados, uma pesquisa de saúde da implantação, uma pesquisa do fornecedor de mensagens enviadas ou outra afirmação determinista ligada à identificação de trabalho original. Transformar a cobertura em um portal de aceitação da produção Execute um canário instrumentado antes de habilitar uma nova versão do agente, integração do quadro, rota do coletor ou mudança de amostragem. Dê ao canário uma identificação de trabalho única e um resultado esperado inofensivo. Em seguida, exigir todas as afirmações aplicáveis: Generação: a geração existe sob a identificação canária. Trace: a extensão da raiz e as operações de criança necessárias são consultáveis. Metric: a janela canária contribui para a série esperada. Freshness:O atraso do coletor permanece abaixo de um limite declarado. Runtime: um recibo de batimento cardíaco ou de agendador prova que o tempo de execução foi alcançável quando esperado. Espera: qualquer pausa nomeia sua razão, proprietário autorizado, prazo de decisão, rota de escalada e manobra de retorno. EEffect: operações de efeitos colaterais se conciliam com uma idempotencia estável ou ID de operação do fornecedor. Ooutcome: uma verificação de destino autorizada comprova a existência do artefato ou estado solicitado. Privacy: a consulta de teste confirma que os campos proibidos de prompt, resposta, segredo e caminho estão ausentes. Mantém os veredictos inconvenientes. O telemetry partial deve bloquear a implantação de instrumentos. O health unknown deve evitar um estatuto verde quando as provas estiverem obsoletas. A waiting deve notificar o proprietário sem reiniciar o trabalho legítimo. O uncertain effect deve parar as retrasas às cegas. O false success deve reabrir a tarefa ou o incidente mesmo quando o rastreamento terminou normalmente. A amostragem precisa de uma decisão separada. Os vestígios pesados podem ser amostrados quando o volume o requer, mas os recibos de saúde compactos necessários para classificar uma corrida necessária não devem desaparecer com eles. Manter identificadores suficientes para correlacionar os vestígios recolhidos na amostra com as receitas de execução, espera, efeito e resultado não recolhidas na amostra. Caso contrário, uma política de telemetria mais barata torna se silenciosamente uma política de correcção mais fraca. Há também um custo operacional. As leituras de destino adicionam latência e chamadas do provedor; batimentos cardíacos em tempo de execução adicionam verificações de armazenamento e frescura; receitas de espera precisam de propriedade de roteamento. Aplicar a menor verificação determinista que resolva a decisão. Uma verificação de existência de arquivo e hash é melhor do que perguntar a outro modelo se o arquivo provavelmente existe. Um juiz LLM permanece útil quando o resultado é semântico, mas registra sua versão, rubrica, escopo de entrada e incerteza ao lado de verificações deterministas. Onde se encaixa o Sidewisp Grafana é um local capaz de inspecionar e correlacionar telemetria. A camada que falta descrita aqui é o julgamento operacional sobre a acessibilidade, o progresso, a espera, os efeitos e os resultadosnão outro espectador de rastreamento. O Sidewisp destina se a tornar se uma camada de saúde em torno dos tempos de execução dos agentes existentes, com evidências explícitas, frescura, incerteza, limites de aprovação e verificação. Não é um gateway de execução de substituição ou modelo obrigatório. Os adaptadores de monitorização da produção e recuperação não são enviados hoje. A Sidewisp está atualmente em prévia privada. Se este limite de evidências coincidir com a forma como você opera agentes, o próximo passo apropriado é juntar se à lista de espera de pré visualização privada e descrever as verificações de tempo de execução e resultados que você precisa. Até lá, mantenha os veredictos de telemetria da Grafana precisos e anexe a conclusão à prova do destino que o seu trabalho realmente requer.