2026-08-01T14:17:47.752Z
LLM Autoavaliação: Calibre o juiz antes de confiar nele
Enviar cada veredicto para provas deterministas, um juiz calibrado LLM específico de critérios, ou revisão humana responsável.
A autoavaliação do LLM é útil quando o critério é genuinamente qualitativo, o avaliador foi testado em relação a rótulos humanos para esse critério exato e a sua resposta é tratada como evidência de apoio. Não deve decidir se existe um ficheiro, um pagamento efectuado, um teste aprovado ou se uma pessoa autorizou uma ação irreversível. Essas perguntas já têm donos mais fortes: controles deterministas ou humanos responsáveis. O padrão prático é, portanto, um roteador, não um juiz universal. Enviar reivindicações verificáveis mecanicamente para o código. Enviar critérios qualitativos limitados a um avaliador calibrado do modelo. Enviar decisões desconhecidas, instáveis ou de grande impacto para uma pessoa. Se faltarem provas, mantenha o veredicto unknown . Um juiz LLM pode ser útil sem ser autoritário A autoavaliação significa pedir a um LLM que avalia a sua própria produção ou a de outro modelo. Uma segunda passagem pode detectar uma contradição óbvia, comparar dois resumos ou classificar uma resposta em relação a uma rubrica. O Aprenda a visão geral de Prompting mostra o padrão básico: gerar uma resposta, depois pedir a um modelo para criticá la ou revisá la. A pesquisa dá a este padrão um papel credível, mas limitado. A Ren e colegas reformula a autoavaliação em aberto como previsões de nível de token e relatou uma melhor precisão de geração seletiva e uma correlação mais forte com a qualidade de saída na TruthfulQA e TL;DR para as suas configurações testadas PaLM 2 e GPT 3. Um estudo mais recente de tarefas em várias etapas revelou que o Autoavaliação gradual superou a pontuação holística para a detecção de falhas em dois conjuntos de dados de referência, com um aumento relativo de até 15% no AUC ROC. Nenhum dos resultados transforma uma opinião modelo em um recibo de entrega. Eles mostram que a autoavaliação pode melhorar uma decisão sob tarefas específicas, instruções, modelos e conjuntos de dados. A unidade de confiança é a configuração do avaliador testado, não a frase "Juzador LLM". Há também modos de falha conhecidos. O jornal MT Bench e Chatbot Arena relata que juízes fortes chegaram a mais de 80% de acordo com as preferências humanas em seu cenário, documentando posição, verbosidade, auto enhancimento e preconceitos de raciocínio. O acordo é encorajador; a lista de preconceitos é operacionalmente decisiva. Um juiz pode ser útil em média e ainda reverter o único veredicto que importa. O viés de posição é fácil de testar. Avalia os candidatos A e B, troca a ordem sem alterar o conteúdo e avalia novamente. Wang e colegas mostrou que as mudanças de ordem poderiam alterar substancialmente os rankings em pares e propôs a calibração de posição equilibrada mais a escalada humana. Se o candidato preferido mudar após a troca, registar o unstable . Não proporcione a contradição em uma pontuação confiante. Congelar o critério antes de calibrar o juiz A "qualidade" é muito ampla para ser calibrada. Um juiz que reconhece um resumo claro pode ainda não ser confiável em fundamentos factuais, interpretação de políticas ou evidência suficiente. Definir um critério com um contrato restrito: O conjunto de calibração requer exemplos que o avaliador não escreveu, rótulos das pessoas que possuem o critério e negativos difíceis o suficiente para expor classificações lisonjeiras ou excessivamente permissivas. Mongelar o identificador de modelo, o prompt de julgamento, a rubrica, os exemplos, o analisador de saída e o limiar juntos. Uma alteração a qualquer um deles cria uma nova versão de avaliador. Os rótulos humanos não são uma vergonha neste processo; eles definem o alvo. A Os autores da EvalGen descreve a "drift de critérios": as pessoas muitas vezes refinam o que significam por um critério depois de verem resultados reais. Essa é uma razão para os critérios de versão e rótulos, não uma razão para esconder o julgamento por trás de uma pontuação modelo. Medir, pelo menos, estas propriedades por critério: Acordo contra os rótulos humanos prolongados; taxa de passagem falsa, porque um avaliador que aprova um resultado ruim cria um falso sucesso; Taxa unknown , que revela falta de cobertura; Estabilidade quando a ordem de candidato e a alteração de formatamento irrelevante; Cobertura por linguagem, família de tarefas, classe de impacto e comprimento de saída; Clusters de desacordo, conservados como exemplos para a próxima revisão. Não combinar critérios não relacionados em uma média tranquilizadora. Suponhamos que a clareza tenha 100% de acordo, que a base tenha 75% e que a segurança tenha apenas dois exemplos rotulados. Uma pontuação misturada de 88% pode ocultar que não existe um portal de segurança defensivel. Mantenha as três fileiras separadas. Os limiares são escolhas políticas, não constantes de um artigo. Uma equipe pode aceitar 80% de acordo para uma sugestão de estilo de baixo impacto e exigir uma prova determinista para um efeito de implantação. A propriedade importante é que o limiar é congelado antes que o candidato à liberação seja marcado. Reproduzir um portão de calibração A seguinte fixação utiliza quatro critérios e oito casos de encaminhamento. O seu limiar é deliberadamente simples: pelo menos três exemplos de etiquetas humanas, pelo menos 80% de acordo e nenhuma alteração do vencedor sob a reversão da ordem. A regra da decisão é pequena: Execute o dispositivo completo com: A repetição produz: Duas observações importam mais do que os números compactos. Primeiro, o dispositivo contém um documento faltante que o juiz chama de pass . O roteador retorna determinista fail . Ele também contém uma correspondência de soma de verificação que o juiz não gosta; o roteador retorna determinista pass . Um modelo pode comentar sobre a apresentação, mas não consegue anular a evidência sobre se o objeto prometido existe e coincide. Em segundo lugar, a qualidade em pares tem um acordo perfeito em quatro exemplos rotulados, mas muda seu vencedor quando os candidatos trocam ordem. O portão ainda falha. O acordo histórico não desculpa uma contradição atual. Esta pequena repetição não é prova de que 80% é seguro para a sua aplicação. É um padrão verificável para provar que cada veredicto chegou ao dono da prova correta. Enviar a decisão ao mais forte detentor de provas Uma vez que a calibração seja aprovada, a decisão sobre o tempo de execução deve preservar três pistas. Deterministic lane. Usar verificações do sistema de arquivos, validação de esquemas, resultados de testes, restrições de banco de dados, recibos de fornecedores, assinaturas, checksums e leituras de destino quando possam responder diretamente à pergunta. Registre o valor observado e a frescura. Um comando que sai de zero prova apenas o contrato desse comando; verifique o resultado externo pretendido separadamente. Juzir o caminho de suporte. Usar um avaliador fixado para critérios como clareza, relevância, tom ou adesão à rubrica quando a cobertura de calibração coincide com o caso atual. Manter o critério, a versão do avaliador, o hash de prompt, a referência de entrada, o veredicto, a explicação e a versão do conjunto de calibração. O modelo apoia o veredicto; a política circundante decide o que essa evidência permite. Lista de revisão humana. Rota de alto impacto, novas línguas, famílias de tarefas descobertas, instabilidade da ordem, exceções políticas e autoridade irreversível aqui. Incluir as evidências contraditórias e uma pergunta concreta. "Revisão por favor" é um encaminhamento fraco; "O recibo determinista está faltando enquanto o juiz diz completopoderá este incidente ser encerrado?" Um resultado unknown é útil. Diz que o sistema não pode atualmente estabelecer a alegação. Transformar o desconhecido em passagem apenas protege um painel de parecer incompleto. Recalibrar em deriva, não apenas em um calendário Um juiz pode deslocar se quando o alias modelo muda, o prompt é editado, exemplos são reordenados, uma nova linguagem chega, as saídas ficam mais longas ou o produto começa a lidar com uma família de tarefas diferente. Recalibração de desencadeamento dessas alterações e monitorização de amostras de desacordo em tempo real entre as revisões programadas. Mantenha dois limites visíveis: 1. A autoavaliação estima uma propriedade qualitativa limitada; não prova a acessibilidade, o progresso útil, os efeitos das ferramentas, a persistência da memória ou a existência entregue. 2. Um avaliador calibrado reduz a carga de revisão; não recebe autoridade humana sobre segredos, gastos, publicação, exclusão ou outras ações irreversíveis. O resultado é uma forma menos teatral de avaliação AI. O juiz consegue um emprego útil, a evidência determinista mantém o seu trabalho mais forte, e as pessoas retêm as decisões que lhes pertencem. A Sidewisp está atualmente em prévia privada. Está a ser desenvolvido como uma camada de saúde em torno dos tempos de execução de agentes existentes, mas a coleta e recuperação de agentes de produção e saúde não são enviados no repositório atual do site. Se este problema de encaminhamento de evidências coincidir com a forma como você opera agentes, você pode se juntar à lista de espera de antevisão privada sem tratar o artigo como uma reivindicação de uma integração de monitoramento ao vivo.