2026-08-01T01:57:54.963Z
Datadog LLM Experimentos de Observabilidade: Adicionar um Portal de Promoção
Impressão digital na comparação, comprova a cobertura de fila, preserve as esperanças válidas e bloqueie os efeitos faltantes ou duplicados antes da promoção.
Os experimentos de observabilidade do Datadog LLM podem dizer lhe que uma arquitetura de candidato, modelo, fornecedor ou agente obteve melhores pontuações e correu mais rápido. Essa é uma prova útil, mas ainda não é uma decisão de libertação. O padrão razoável é comparar o candidato e a linha de base dentro do mesmo projeto Datadog, pinar a versão do conjunto de dados, manter as definições de avaliador estáveis e inspecionar a distribuição e os traços em vez de confiar em uma média. Depois, adicione um pequeno portal de promoção fora do cartão de pontuação: prove que todos os registros exigidos foram executados, as esperanças esperadas permaneceram esperando, os casos mutantes produziram exatamente um efeito, e os casos concluídos têm um recibo de destino. Este artigo implementa esse último passo com uma fixação de oito registros. O candidato muda a taxa de aprovação do avaliador de 75% para 100% e a duração média de 980 ms para 738,75 ms . A promoção ainda está bloqueada. Uma restituição não tem recibo de destino verificado e uma cancelamento produziu dois efeitos. Primeiro provem que os dois experimentos são comparáveis Análise geral das experiências de Datadog descreve três operações principais: conjuntos de dados de versão, executar experimentos e comparar resultados. O Documentação de instalação atual define um experimento como uma tarefa executada sequencialmente em registros de conjuntos de dados, com avaliadores de registros e avaliadores de resumo opcionais. As tarefas internas podem usar os mesmos decoradores de rastreamento que o código de produção. Esses primitivos dão lhe um bom material para uma comparação. Não eliminam a necessidade de definir o que deve permanecer idêntico entre as duas corridas. Antes de olhar para as pontuações, grava um manifesto livre de conteúdo: Os hashes identificam o código do avaliador; não são hashes de instruções, saídas, credenciais ou dados de clientes. Hash a serialização canônica JSON deste manifesto e anexe a impressão digital a ambos os registros do experimento. A fixação produz: Se as impressões digitais diferirem, deixe de chamar o resultado de uma comparação em pares. Uma versão alterada do conjunto de dados pode adicionar casos difíceis. Um avaliador alterado pode mudar o limiar. Um registro faltante pode melhorar a média removendo o fracasso que importa. Essas alterações podem ser legítimas, mas exigem uma nova linha de base. O Passagem do produto do Datadog diz que os conjuntos de dados suportam o controle de versões e podem ser fixados em versões específicas. Ele também explica que a superfície de comparação expõe médias, distribuições, latência, custo, contagem de tokens, saídas e traços de intervalos. Usa tudo isso. O manifesto não substitui a evidência do Datadog; evita a deriva acidental da comparação antes de interpretá la. Execute um portal que pode discordar das médias O artefato inspecionável para este artigo é um script Python de biblioteca padrão. Contém oito discos sintéticos, sem conteúdo e emite JSON. Faça isso com: A regra central é deliberadamente pequena: Isto não pergunta a um segundo modelo se o primeiro modelo parecia bem sucedido. Verifica campos explícitos cujo significado você controla. Os rendimentos da fixação completa: Medida Linha de base Candidato : : Registros presentes 8/8 8/8 Taxa de aprovação do avaliador 75% 100% Duração média 980 ms 738,75 ms Bloqueio de registos — 2 Decisão de promoção — Block O Guia para desenvolvedores de avaliação do Datadog suporta os resultados do avaliador digitalizado, uma avaliação opcional de aprovação/falha, metadados, etiquetas e avaliadores de resumo. Isso torna um avaliador uma fonte adequada para o evaluatorPass . Não faz de cada avaliador um verificador de destino. Se o seu avaliador comparar o texto gerado com uma resposta esperada, ele pode passar enquanto o reembolso nunca chega ao livro. Mantenha estas vias de evidência separadas: E Valorador: A saída satisfaz a regra de qualidade escolhida? Trace lane: Qual LLM, passo de recuperação, ferramenta e tarefa foi executado, e com que erros ou latência? Lanha de estado: O caso estava funcionando, aguardando legitimamente, completo, incerto ou necessitando de uma pessoa? EEffect lane: A mutação externa prevista ocorreu exatamente uma vez? O via de saída: O destino agora contém o resultado prometido? As duas primeiras vias são entradas naturais de Experimentos Datadog. As outras faixas vêm do contrato de tarefa, dos aparelhos e dos sistemas de destino. Pode enviar os resultados como avaliações personalizadas ou metadados de experiências, mas define os na fronteira que possui a verdade. Os dois registos bloqueados revelam falhas diferentes O registro issue refund tem um avaliador de passagem, um estado complete e um efeito tentado. O seu outcomeReceipt é missing . Não se trata de uma prova de falha da restituição; é uma prova de não verificação da conclusão. O veredicto seguro é uncertain , não verde e não uma retoma automática. O registo cancel subscription possui um avaliador de passagem e um recibo de destino verificado, mas o effectCount é duplo. Um estado final bem sucedido não elimina o efeito duplicado. O candidato é bloqueado porque a mudança enfraqueceu a segurança, mesmo melhorando a pontuação agregada. O registo approval required demonstra o limite oposto. Seu estado esperado é waiting , e o candidato fornece um token de proprietário, prazo e retorno. Passa se. Uma pausa com uma dependência conhecida não é um impasse, então um portal que requer que cada linha termine em complete puniria o comportamento correto. Estes casos são intencionalmente inconvenientes. Se um portal de promoção apenas repetir a pontuação do avaliador, não pode alterar a decisão de libertação. Um portão útil deve ser capaz de dizer: A comparação é inválida porque a cobertura dos registos mudou; O candidato é melhor em termos de qualidade, mas inseguro em termos de efeitos; O candidato é mais rápido, mas deixou um resultado desconhecido; A espera é válida e não deve ser considerada um fracasso; As evidências conflitam, por isso uma pessoa tem de decidir. Ligue o portão a um verdadeiro experimento Datadog O guia de configuração atual do Datadog requer ddtrace =4.3.0 para o caminho documentado de Experimentos Python e requer uma chave API e uma chave de aplicação. Mantenha esses segredos em variáveis ambientais; não os coloque em um manifesto, linha de conjunto de dados, artefato de artigo ou atributo rastreador. Para um fluxo de trabalho de experimento existente, adicione o gate em cinco passos limitados. 1. Congelar o contrato de comparação. Registrar o projeto Datadog, identidade e versão do conjunto de dados, IDs de registro ordenados, hashes de código de avaliador, revisão de tarefa, configuração de candidato e estado esperado para cada registro. Armazenar apenas IDs ou hashes opacos quando o conteúdo é sensível. 2. Reconciliar a cobertura antes de calcular uma taxa. Comparar os registros de registros esperados com registros de experimentos observados. Identidades faltantes, duplicadas ou inesperadas não são comparáveis. Não reduzir silenciosamente o denominador às fileiras que retornaram. 3. Emite campos deterministas no limite da tarefa. Para uma tarefa de somente leitura, o recebimento pode ser uma resposta válida de esquema vinculada à revisão de fonte esperada. Para uma tarefa mutante, use uma chave de idempotency, identidade de efeito e uma busca do lado de destino. Conte os efeitos cometidos, não as tentativas de retomada. 4. Preservar estados não terminais. Um caso de espera precisa de uma razão, proprietário, prazo e identidade de retomada. Um caso de credenciais pode terminar corretamente como needs human . Não fabrique uma resposta para facilitar uma pontuação offline. 5. Promover apenas em conjunção. O candidato pode ser promovido quando o manifesto coincide, a cobertura é completa, os avaliadores necessários aprovam, os orçamentos operacionais mantêm se, cada estado coincide com o seu contrato, cada resultado concluído é verificado e cada caso de mutação tem exatamente um efeito pretendido. Uma média ponderada não é um substituto porque uma pontuação elevada pode compensar matematicamente um único efeito catastrófico. Uma política prática é: Ajustar os limiares para as métricas de qualidade, de latência e de custo de aconselhamento. Mantenha os recibos perdidos, efeitos duplicados, exposição secreta e comparações inválidas como falhas difíceis, a menos que o seu domínio forneça uma regra explícita mais segura. Saber o que esta auditoria não prova A fixação prova os seus próprios oito casos e implementação da regra. Não prova que o seu conjunto de dados represente o tráfego de produção, que as saídas esperadas sejam corretas, que os hashes do avaliador correspondam ao código revisto ou que os recibos de destino não possam ser falsificados. Também não mede a qualidade dos produtos da Datadog nem compara modelos. Essas questões exigem revisão dos conjuntos de dados, controlo da fonte, controlo de acesso, amostragem da produção e reconciliação com o destino real. Os Experimentos Datadog continuam sendo o lugar para estudar as corridas de experimentos, distribuições, vestígios e resultados de avaliadores. O portal de promoção acrescenta uma decisão operacional mais restrita: este comparativo específico é completo e seguro o suficiente para autorizar a mudança? A direção do produto da Sidewisp é facilitar a interpretação das evidências, incertezas e verificações sobre a saúde dos agentes em tempos de execução existentes. Não substitui o Datadog, o seu tempo de execução ou o seu processo de liberação. A Sidewisp está atualmente em prévia privada. O local público e a demonstração interativa são em directo; a coleta de agentes de produção e saúde e a integração do Datadog geralmente não são enviadas.