2026-08-01T09:31:06.060Z

Avaliação LLM: Orientação de cada decisão para a prova correta

Avaliações offline separadas, portões de regressão, verificações de qualidade ao vivo, saúde no tempo de execução e verificação de resultados antes de uma pontuação verde esconder um resultado quebrado.

A avaliação LLM é a prática de testar se um sistema movido por modelo atende a um critério definido em uma meta definida. O padrão útil é simples: nomear a decisão primeiro, e depois recolher as evidências mais estreitas que possam apoiá la. Um conjunto de dados selecionado pode apoiar uma alegação de qualidade pré lançamento. Uma comparação de linha de base pode apoiar uma decisão de regressão. As corridas de produção recolhidas em amostras podem revelar a deriva de qualidade ao vivo. Nenhuma delas, por si só, prova que um agente foi acessível, completou um efeito de ferramenta, ou entregou o artefato prometido. Esse limite é importante porque a avaliação aprovada parece mais ampla do que é. Uma pontuação sempre tem um alvo, um relógio e provas faltantes. Tratá lo como um veredicto de saúde universal cria um verde falso: a resposta parece boa enquanto o processo ou o resultado é quebrado. Comece com a decisão, não com a métrica. Antes de escolher a correspondência exata, uma pontuação de inserção, um juiz LLM ou uma plataforma, escreva uma frase na seguinte forma: Na esta vez , decida esta ação da esta meta usando esta evidência . Essa frase encaminha o trabalho para uma faixa: Decisão Alvo Relógio Evidências mínimas Reclamação mais forte susceptível de ser apoiada Um candidato é bom o suficiente? Exemplos curados Antes da implantação Set de dados, marcador específico de tarefa O candidato satisfaz o critério designado neste conjunto de dados A liberação regressou? Linha de base e candidato Na liberação Corridas em par, limiar O candidato não ultrapassou o limite de regressão A qualidade da vida está a flutuar? Lutas de produção incluídas na amostra Durante o trânsito Amostra fresca, avaliador de produção Esta amostra atende ou não ao critério de vida O agente está saudável? Tempo de execução e trabalho esperado No tempo de execução esperado Batimento cardíaco, horário, recibo de progresso O tempo de execução é acessível e o trabalho útil está a avançar O resultado pretendido aconteceu? Destino externo Após o prazo de vigência ou de conclusão Receita de destino, montante de verificação, teste de aceitação O efeito ou o produto entregue existe e passa a verificação As duas últimas linhas não são melhores avaliações. Um avaliador pode inspecionar uma resposta ou rastrear; a saúde operacional precisa de evidências sobre o processo que deve ser executado; a verificação dos resultados precisa de evidências do destino onde o resultado deve existir. Avaliação offline apoia as alegações limitadas de pré lançamento O Orientação de avaliação da OpenAI define um fluxo de trabalho útil: estabelecer o objetivo, coletar um conjunto de dados, definir métricas, executar comparações e continuar a avaliar à medida que o sistema muda. Também adverte contra métricas genéricas e avaliação baseada em vibe. A implicação prática é que uma pontuação offline precisa de uma decisão de libertação anexada a ela. Suponha que um agente de suporte tenha de selecionar a ferramenta correta, passar o identificador da conta correta e retornar uma resposta compatível com as políticas. Não as coloque numa média. Usar três controles: Verificações exatas ou baseadas em esquemas para a ferramenta e os argumentos selecionados; Uma rubrica de qualidade específica da tarefa para a resposta; Uma verificação determinista para qualquer campo de saída exigido pelo contrato de aplicação. Em seguida, compare o candidato atual com a linha de base de liberação nos mesmos casos. Um candidato que melhora o estilo de resposta, mas reduz a precisão da identificação da conta não é 0.7% melhor. Trocou uma classe de falha por outra. O portal de liberação deve indicar se esse comércio é permitido. O teste de regressão é, portanto, um uso particular da avaliação offline, e não é sinônimo de toda a avaliação. Requer uma linha de base estável, casos emparelhados e um limiar ligado a uma ação de liberação. Registre a versão do conjunto de dados, a versão de pontuação, o modelo e a configuração do prompt, a contagem de amostras e os desentendimentos. Sem esse manifesto, uma mudança de pontuação não pode ser atribuída com segurança. O piso razoável pode ser pequeno. Cinco a dez exemplos cuidadosamente revisados por componente crítico são mais úteis do que um grande conjunto sintético com critérios de aceitação pouco claros. Ampliar o conjunto a partir de incidentes reais, casos de borda e discordâncias entre os revisores. Um conjunto de dados deve tornar se mais difícil porque o sistema lhe ensinou onde falha, não porque um painel de instrumentos recompensa a conta de casos. A avaliação online observa o comportamento ao vivo, com referências mais fracas A Os conceitos de avaliação de LangSmith faz uma importante distinção de alvo. As avaliações offline são executadas com base em conjuntos de dados e exemplos, muitas vezes com resultados de referência. As avaliações on line são realizadas em circuitos de produção ou em fios, onde normalmente não existe uma referência correta. Isso muda o que o veredicto pode significar. Um avaliador on line pode marcar um padrão de segurança, saída malformada, deriva do tópico, baixa satisfação do usuário ou uma trajetória incomum. Também pode colher casos vivos difíceis para o conjunto de regressão offline. Não pode herdar silenciosamente a confiança de um ensaio de referência. Sua amostra pode ser obsoleta, filtrada, não representativa ou marcada por um juiz que se afastou. Para cada regra online, retém: A política de amostragem e as exclusões; O identificador de corrida ou de fio, sem vazamento de conteúdo sensível; A versão e a rubrica do avaliador; O tempo de observação e a janela de frescura; A ação desencadeada por um erro; Um caminho para revisão humana e captura de desentendimentos. A Documentação do Kit de Desenvolvimento de Agentes do Google separa a avaliação da trajetória de utilização das ferramentas da avaliação da resposta final. Isso é útil, mas a correspondência de trajetória requer moderação. Dois agentes válidos podem resolver a mesma tarefa através de diferentes sequências de ferramentas. A correspondência exacta da trajetória é apropriada quando a ordem faz parte do contrato de segurança; caso contrário, verifique os efeitos exigidos e as ações proibidas, em vez de exigir um caminho ideal. O acompanhamento da produção também contém sinais de não avaliação. Latência, taxa de erro, uso de tokens e integridade de rastreamento descrevem o comportamento do serviço. Um avaliador de qualidade da resposta descreve o conteúdo ou o comportamento da amostra. Nenhum dos dois estabelece que o trabalhador programado de amanhã seja acessível. Mantenha estas alegações separadas, mesmo que uma plataforma as exija juntas. O limite final precisa de recibos, não de outro juiz. Três casos da fixação do artigo produziram a mesma armadilha: uma pontuação genérica LLM passou, mas o único veredicto defensivel foi UNKNOWN . 1. O caso de saúde no tempo de corrida tinha um cronograma esperado e um histórico de progresso, mas nenhum batimento cardíaco novo. O antigo bom trabalho não provou a disponibilidade atual. 2. A caixa de efeito ferramenta tinha uma identificação de operação estável, mas nenhum recibo do destino. Uma pausa de tempo pode esconder ou nenhum efeito ou um efeito completo. 3. O caso final de entrega tinha uma definição de teste de aceitação, mas nenhuma quantidade de verificação de artefatos. Não havia nada concreto para testar. Um juiz da LLM não pode reparar estas lacunas. Perguntar a um modelo se um trabalhador provavelmente está vivo não cria um batimento cardíaco. Perguntar se um e mail foi provavelmente enviado não cria um recibo do fornecedor. Perguntar se um arquivo soa completo não prova que o arquivo existe no caminho exigido. Prefere evidências deterministas perto da fronteira: um batimento cardíaco fresco e um registro de disponibilidade de tempo esperado; Um recibo de progressos vinculado a uma identificação de execução não secreta para execução; Uma chave de idempotencia mais um destino de leitura para efeitos externos; Uma soma de verificação, validação de esquema, resultado do ensaio ou consulta de destino de um produto entregue; Um recibo autorizado de decisão relativa a uma ação irreversível. A evidência desaparecida deve continuar desaparecida. O UNKNOWN é um estado operacionalmente útil porque realiza investigações sem inventar sucesso ou fracasso. Reproduzir a auditoria de roteamento de evidências em oito casos O artefacto inspeccionável utilizado para este artigo contém oito casos de decisão. Cada caso declara a decisão, as evidências disponíveis, o caminho esperado e o veredicto esperado. A política central é deliberadamente mecânica: A fixação abrange a qualidade dos candidatos, a regressão de liberação, a deriva da qualidade ao vivo, a saúde no tempo de execução, os efeitos externos, os resultados finais, a revisão subjetiva e a autoridade humana. A execução produziu: Todos os oito casos chegaram à sua linha de evidências esperada. Cinco tinham provas suficientes para a sua alegação limitada. Três eram desconhecidos, e todos os três teriam parecido verdes se a política tivesse aceitado uma pontuação genérica de passagem. Este não é um padrão universal. Substitua o dispositivo por decisões de um fluxo de trabalho real. Adicione os nomes exatos de provas que o seu tempo de execução e destinos podem produzir. Manter o comportamento de falha: se um sinal requerido estiver ausente, retornar desconhecido e listar os campos ausentes. Não converta a ausência em uma pontuação zero, porque o zero sugere que ocorreu a medição. Escolha o marcador apenas após o alvo da prova Uma vez que o alvo é correto, a seleção dos marcadores torna se mais fácil. Use código quando a propriedade é determinista: forma JSON, nome da ferramenta, intervalo de argumentos, soma de verificação, presença de arquivo, estado de teste ou estado de destino. Use um juiz LLM quando a propriedade é genuinamente qualitativa e você tem uma rubrica clara, um conjunto de calibração e um caminho de revisão de desacordo. A orientação da OpenAI observa que os modelos são muitas vezes mais confiáveis na discriminação entre opções do que na produção de julgamentos abertos, por isso a comparação ou classificação em pares pode ser mais forte do que uma pontuação sem restrições. Utilize revisão humana quando a decisão envolve gosto sem uma rubrica estável, autoridade legal ou política, ambiguidade de alto impacto, segredos ou ação irreversível. Um juiz pode resumir as provas para o revisor; não pode tornar se a pessoa autorizada. O Documentação de avaliação do MLflow descreve conjuntos de dados, marcadores, funções de previsão, feedback humano, avaliação sistemática e monitoramento de produção como capacidades relacionadas. É um menu útil de implementação. A regra de roteamento ainda pertence ao proprietário da aplicação: a ferramenta pode calcular uma pontuação, mas apenas o proprietário pode definir qual decisão a pontuação é autorizada a apoiar. Mantenha quatro veredictos no registro de libertação e operações Um registo de avaliação compacto deve responder de forma independente a quatro perguntas: O candidato cumpriu os seus critérios de qualidade offline? Evitou uma regressão proibida em relação à linha de base? Uma amostra de produção fresca satisfaz os seus critérios em linha? O trabalho esperado é saudável e o resultado prometido é verificado? Não medite essas respostas. Um lançamento pode passar por uma avaliação offline enquanto a evidência ao vivo ainda não está disponível. Uma amostra de produção pode parecer saudável enquanto se perde uma corrida programada. Um rastro pode parecer completo enquanto o artefato final estiver ausente. Preserva cada veredicto, o tempo da prova e o seu alcance. Isso produz uma regra de operação mais calma: avaliar o comportamento do modelo e da aplicação com conjuntos de dados e corridas de amostragem; avaliar a saúde do tempo de execução com evidências de acessibilidade, cronograma, espera e progresso; verificar os resultados externos em seu destino. Escala apenas a faixa desaparecida ou falhada. A Sidewisp está atualmente em prévia privada. Está a ser concebido como uma camada de saúde para os tempos de execução dos agentes existentes, mas os adaptadores de monitorização da produção e os sistemas de recuperação não são geralmente enviados. Se a distinção entre uma corrida de boa aparência e um resultado verificado é o problema que você está tentando resolver, a lista de espera de pré visualização privada é o próximo passo apropriado.