2026-08-01T03:55:22.158Z

Azure LLM Observabilidade: Auditamento da lacuna verde recolhida na amostra

Testar a frescura dos vestígios, a visibilidade do RBAC, a cobertura da avaliação, as esperanças legítimas e um recibo de destino antes de tratar uma fábrica de fundição verde como saudável.

A observabilidade do Azure LLM deve responder a mais do que fez uma corrida terminar? Antes de aceitar um veredicto saudável, prove quatro condições para a mesma corrida: a telemetria é questionável e fresca, o estado de execução é compreendido, cada verificação de qualidade requerida realmente cobriu a corrida e o resultado prometido existe em seu destino. A Microsoft Foundry dá lhe peças úteis dessa evidência. Pode colocar traços do lado do servidor em Azure Monitor Application Insights, mostrar métricas operacionais no Painel de Monitoramento de Agentes e executar avaliações contra respostas de produção de amostra. Essas peças não são intercambiáveis. Um rastro pode ser fresco enquanto um avaliador salta a corrida. Um avaliador pode passar enquanto um arquivo, bilhete, implantação ou mensagem nunca chegou ao seu destino. Uma corrida concluída também pode estar à espera de uma decisão humana legítima que o aplicativo modela mal. O incumprimento prático é, portanto, uma auditoria da cobertura e não uma pontuação composta. Mantenha indisponíveis as evidências, trate a amostragem como cobertura em vez de sucesso, e deixe um recibo de resultados específico da carga de trabalho fechar a lacuna final. Leia as superfícies da fundição como evidências separadas . O Visão geral da observabilidade da Microsoft separa três capacidades: Tracing registra o caminho de execução, incluindo chamadas de modelo, uso de ferramentas, latência e intervalos relacionados. Monitoring resume medidas operacionais como tokens, latência, taxa de erro e sucesso de execução. Evaluation mede propriedades de qualidade ou de segurança selecionadas com avaliadores incorporados ou personalizados. Que a separação é importante durante um incidente. Um período de tempo bem sucedido estabelece que uma operação instrumentada atingiu o status de terminal. Não estabelece que o painel atual possa ver todos os intervalos relevantes, que um avaliador tenha examinado essa resposta ou que tenha ocorrido o efeito colateral solicitado. A Fundição guia de configuração de rastreamento estabelece dois limites úteis explícitos. Primeiro, o rastreamento do lado do servidor do agente hospedado começa após o projeto ser conectado ao Application Insights. Em segundo lugar, novos vestígios podem demorar alguns minutos para aparecer. Se o rastro esperado estiver ausente, o veredicto responsável não é failed ou healthy. É evidence unavailable até que você distingua conexão, autorização, atraso de ingestão, amostragem e instrumentação. A consulta de acesso é outra condição independente. A documentação de monitoramento da Foundry requer acesso adequado baseado em funções do Azure ao Application Insights e, para visualizações de log, ao espaço de trabalho de Log Analytics associado. Um operador que pode abrir o projeto mas não pode consultar a telemetria protegida tem um problema de visibilidade, não evidências de um agente saudável. A mesma precaução aplica se à guia Monitor. O Guia de Painel de Monitoramento de Agentes descreve a taxa de sucesso de execução, tokens, latência e resultados de avaliação. Diz também que a avaliação contínua é executada sobre as respostas sampladas . A amostragem é uma decisão válida sobre custos e rendimentos, mas cria uma questão denominadora: esta corrida em particular recebeu todas as avaliações necessárias para a decisão que está a tomar? Não responda a essa pergunta com uma pontuação agregada. Grava o por corrida. Dá um registro de cobertura. Comece com um pequeno disco sem conteúdo. Mantenha identificadores ou hashes que permitam que um operador autorizado encontre a evidência subjacente; não copie instruções, argumentos de ferramentas, segredos ou resultados de modelos em uma nova loja de saúde. Cada campo responde a uma decisão: 1. Pode o operador recuperar a telemetria atual? Teste a conexão Application Insights e a permissão de consulta real. Uma página de portal de carregamento não é o teste. 2. É o rastro suficientemente fresco para este fluxo de trabalho? Estabelecer um orçamento a partir da duração prevista da corrida mais o atraso observado na ingestão. Não reutilize silenciosamente o espaço verde de ontem. 3. O que faz o agente? Preserva working , waiting , succeeded , e estados de falha. Uma aprovação nomeada ou dependência externa é uma espera, não um impasse. 4. O avaliador necessário cobriu esta corrida? Cobertura da loja separadamente do resultado do avaliador. 5. O resultado prometido ocorreu? Pergunto o destino que possui o resultado. A verificação de resultados deve corresponder ao trabalho. Para um relatório gerado, verifique que o objeto esperado existe e que seu hash ou esquema é correto. Para uma atualização do bilhete, leia o bilhete e verifique a transição prevista. Para uma mutação da API, consulta o recurso alvo em vez de confiar no sucesso do intercâmbio HTTP do cliente. Para uma tarefa de código, exigir a diferença esperada mais o resultado de construção ou teste relevante. Este registro evita deliberadamente um campo universal de sucesso. Combinar evidências diferentes muito cedo é como a cobertura desconhecida se torna verde. Repete a decisão antes de alarmes de cablagem O aparelho usado para este artigo contém oito corridas sintéticas e nenhuma credenciais, instruções ou telemetria de produção do Azure. O seu classificador avalia a visibilidade antes do estado de execução, o estado de execução antes da qualidade e a qualidade antes do resultado: A execução do node audit azure observability.mjs contra a fixação produziu oito correspondências e nenhuma descoincidência: Caso Evidências do lado Azure Evidências de destino O veredicto Conexão presente, consulta negada Não pode inspecionar a telemetria corrente Presente de recibo EVIDENCE UNAVAILABLE Traços antigos, todos os outros campos verdes. O que se passa? Presente de recibo EVIDENCE STALE Traços frescos, executar ativamente Actividade atual Ainda não esperado WORKING Traço fresco, nomeado espera aprovação Atendimento atual Ainda não esperado WAITING Execução bem sucedida, avaliação necessária saltado Ausência de cobertura de qualidade Presente de recibo QUALITY UNKNOWN Execução bem sucedida, avaliação amostrada falhou Qualidade falhou Presente de recibo QUALITY FAILED Execução e avaliação bem sucedida Completado na fundição Receita ausente FALSE COMPLETE Execução e avaliação bem sucedida Completado na fundição Presente de recibo HEALTHY Dois resultados são fáceis de manipular mal. O QUALITY UNKNOWN não é um avaliador falhado. Diz que o avaliador não cobriu a duração necessária para esta decisão. Você pode encaminhar esse estado para um substituto determinista, uma avaliação única quando apropriado, ou uma revisão humana. Não é possível reetiquetar a pontuação agregada do painel como resultado desta corrida. O WAITING também não é um fracasso. Se o rastro for fresco e identificar um proprietário legítimo e dependência, a ação útil é a de expor a espera para esse proprietário. Reiniciar o agente pode duplicar o trabalho ou descartar o contexto sem resolver a dependência. Configurar alertas sobre a condição falhada, não a cor Um alerta deve indicar as provas que se quebraram: Telemetria indisponível : verifique a conexão Foundry to Application Insights, consulta RBAC, acesso à tabela protegida, instrumentação e tráfego recente. E evidência stale : comparar o último tempo observado de rastreamento com o orçamento de frescura do fluxo de trabalho e o atraso conhecido na ingestão. Qualidade desconhecida : inspecionar a taxa de amostragem configurada e verificar se esta decisão requer realmente um avaliador. Qualidade falhada : preserve o nome do avaliador, a versão, o limiar e o identificador da execução testada antes de investigar. Falso completado : parar repetidas tentativas automatizadas na fronteira de efeitos colaterais e reconciliar o destino com um identificador de trabalho estável. Isto produz operações mais silenciosas do que um alerta sobre cada amostra ou longa duração ausente. A orientação do painel de instrumentos da Microsoft oferece um amplo limiar de investigação, como a análise de baixas taxas de sucesso de execução ou de alta latência. Esses sinais da frota são úteis para encontrar uma coorte. O registo de cobertura por execução decide o que está errado com uma determinada peça de trabalho. A frescura também precisa de um dono. A retenção da Application Insights controla quanto tempo a evidência permanece interrogável; as permissões de ingestão e consulta controlam se ela é visível agora. Armazenar o último tempo de consulta bem sucedido e o mais recente tempo de rastreamento correspondente separadamente. O painel carregado não prova nada. Mantenha visível a pré visualização e os limites de privacidade A documentação atual da fundição marca partes do rastreamento e monitoramento de agentes como antevisão. O visão geral do agente de rastreamento diz que o rastreamento está geralmente disponível para agentes de prompt e hospedados, enquanto o rastreamento de fluxo de trabalho e de agentes externos estão em antevisão. O guia de monitorização também marca as características do painel de instrumentos como visualização. Registrar o tipo de agente e o estado das características no cadastro; não transferir garantias de um caminho de agente hospedado para um fluxo de trabalho externo sem verificar o contrato em curso. O rastreamento pode capturar instruções, saídas, argumentos de ferramentas e resultados de ferramentas. A Microsoft aconselha a redacção de conteúdos sensíveis antes de atingir a telemetria e a aplicação de controles de acesso e retenção à produção. Uma camada de saúde deve fazer referência às evidências com identificadores sem conteúdo, sempre que possível, e não criar um segundo depósito de cargas úteis sensíveis. Há uma última limitação a manter ao lado do veredicto: este classificador testa a prioridade da evidência. Não se comunica com uma assinatura do Azure, não deduz um objetivo de nível de serviço de ingestão nem decide o que significa sucesso para o seu aplicativo. O recibo de destino é deliberadamente específico da carga de trabalho. Esse limite é o ponto. A observabilidade do Azure LLM pode expor execução, desempenho, qualidade de amostragem e evidências de depuração. A saúde operacional também requer frescura, cobertura, estado de espera correto e prova do resultado esperado. A Sidewisp está atualmente em prévia privada. A sua direção é transformar as evidências dos tempos de execução dos agentes existentes em uma visão clara da saúde, preservando a incerteza e os limites de aprovação humana; a monitorização da Microsoft Foundry não é apresentada aqui como uma integração Sidewisp enviada.