2026-08-01T14:17:54.256Z
Metricas de Avaliação do Agente AI: Cinco sinais, sem pontuação composta
Use cinco denominadores explícitos e portões de evidências duras para comparar os lançamentos de agentes sem ocultar falsos sucessos, efeitos de ferramentas desconhecidos ou falhas caras.
As métricas de avaliação do agente AI devem responder a uma pergunta de liberação, não decorar um painel de instrumentos. Para um agente que usa ferramentas, um padrão compacto é cinco medidas mantidas separadas: qualidade da tarefa, progresso útil, integridade do efeito ferramenta, custo por resultado verificado e taxa de fracasso. Registrem a cobertura de provas ao lado de cada um. Então, faça os resultados perdidos e os efeitos de ferramentas desconhecidos por portas duras antes de otimizar as médias. Que a ordem importa. Um candidato pode escrever melhor prosa, terminar mais rápido e parecer mais barato por corrida enquanto produz um resultado não verificado. A media desses sinais em uma pontuação transforma uma liberação insegura em uma melhoria numérica. Mantenha cinco denominadores em vez de uma pontuação A avaliação de agentes tem mais de um objeto de interesse. O Guia de engenharia da Anthropic para avaliações de agentes distingue tarefas, ensaios repetidos, classificadores, transcrições e o estado final do ambiente. O seu exemplo de reserva de voo é o limite útil: a transcrição pode dizer que um voo foi reservado, enquanto o resultado é se a reserva existe na base de dados. A corrente Descrição da avaliação do agente Vertex AI faz outra separação. A avaliação da resposta final pergunta se o agente atingiu o objetivo; as métricas de trajetória inspecionam o caminho, incluindo correspondências exatas ou ordenadas de ação, precisão, recall e uso de uma única ferramenta. Ambos os pontos de vista são úteis, mas nenhum deles deve substituir silenciosamente o outro. Use este contrato de cinco métricas: Métrica Numerador Denominador Preservação separada Função de liberação Qualidade das tarefas soma das pontuações de qualidade de rubrica ou determinista em versão Ensaios para os quais o avaliador de qualidade realmente correu Versão de notação, cobertura, desacordo Otimizar depois que as provas duras passarem Progresso útil Janela de observação ativa com um delta de evidências específico da tarefa Janela ativa observada Janela de espera explícita e colecionadores obsoletos Pavimento, depois otimizar Integridade do efeito ferramenta Efeitos externos verificados no destino Tentativas verificadas + falhadas + incógnitas de efeito Chamadas intencionalmente negadas, efeitos desconhecidos Pavimento duro Custo por resultado verificado Total dos custos de exploração cobertos Resultados verificados por destino Custo estimado, falta de cobertura de faturamento Planos orçamentais e otimização Taxa de falhas Conclusões declaradas cuja verificação de resultados falhou Todas as conclusões declaradas Completos cujo verificador não estava disponível Veto duro Cada denominador impede uma mentira diferente. A qualidade média sem cobertura de graduação recompensa os exemplos mais fáceis. O sucesso da ferramenta sem evidências de destino confunde uma chamada bem sucedida com um efeito bem sucedido. O custo por corrida recompensa falhas baratas. A taxa de conclusão recompensa um agente por avaliar a sua própria reivindicação. A telemetria operacional ainda pertence ao livro. O OpenTelemetry Impressão de métricas GenAI fixado define instrumentos de status de desenvolvimento para uso de tokens, duração de operação, duração de agente, contagem de inferências, contagem de chamadas de ferramentas e duração de ferramentas. Essas medições explicam a carga de trabalho e a eficiência. Não afirmam que exista um ficheiro, que uma fatura tenha sido criada uma vez ou que um relatório programado tenha chegado ao seu destino. Escrever o registro da evidência antes de escolher os limiares Começa com uma fila por julgamento. Não comece com um gráfico agregado. Um registro mínimo precisa de informações suficientes para reproduzir cada numerador, denominador, exclusão e estado indisponível: O valor importante não é o 0.90 ; é o desacordo em torno dele. O indicador de resposta gostou da saída, mas o verificador de resultados não estava disponível e o efeito da ferramenta permaneceu desconhecido. Este ensaio pode ensinar lhe sobre a qualidade da resposta. Não pode apoiar uma alegação de libertação. Use três estados de evidência sempre que a ausência seja possível: verified significa que o predicado nomeado foi contra o destino previsto e passou. failed significa que o predicado foi executado e o estado esperado foi ausente ou inaceitável. unavailable significa que nenhum veredicto foi possível porque o verificador, coletor, permissão ou provas de destino estavam faltando. Não converta o unavailable em zero ou sucesso. O zero é uma medição; não disponível é um defeito de cobertura. A espera precisa de cuidados semelhantes. Uma corrida com um proprietário de aprovação explícita, a decisão solicitada, o prazo e o estado reiniciável não ficam presos. Contar progressos úteis durante as janelas ativas antes da espera, em seguida, parar o relógio de progressos ativos. Mantém a chamada de ferramenta de alto impacto negada como prova de que a fronteira funcionou; não considere uma negação intencional como falha da ferramenta. A qualidade da tarefa é a única métrica que provavelmente precisa de vários tipos de graduação. Use testes deterministas para campos estruturados, arquivos, linhas de banco de dados, status HTTP e condições de política exatas. Um classificador de modelo pode avaliar o tom, a relevância ou um artefato sem fim, mas armazenar seu prompt, modelo, versão rubrica e amostra de calibração. A revisão humana continua a ser necessária quando o julgamento é consequente ou não se entende a taxa de desacordo do indicador modelo. Reproduzir a reversão da liberação O artefato conservado neste artigo contém dez ensaios sintéticos: cinco para o stable v1 e cinco para o fast v2 . Execute com Node.js 20 ou mais recente: Os limiares declarados são: O resumo exato é: Variante Qualidade Progresso útil Efeitos da ferramenta verificados Custo / execução Custo / resultado verificado Falso sucesso Completo não verificado Portão : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 Passagem fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 FALHO Três observações alteram a decisão. Primeiro, o fast v2 parece mais barato quando o denominador é executado: 0,38 dólares em vez de 0,41 dólares. Uma vez que o gasto é dividido por resultados verificados, a conclusão é invertida: 0,63 dólares em vez de 0,52 dólares. A versão mais rápida gasta menos em cada tentativa e mais em cada resultado em que se pode confiar. Em segundo lugar, a pontuação de qualidade superior de 0,902 não repara um resultado perdido. Uma finalização polida falhou no controlo ambiental; outra não tinha verificador utilizável. As médias de qualidade e de progresso útil permanecem diagnósticas, mas não são autorizadas a publicar, pagar, enviar mensagens, excluir ou de qualquer outra forma aceitar um efeito externo. Em terceiro lugar, o stable v1 contém uma espera legítima de aprovação. Não está presente no denominador de qualidade do ensaio concluído, mas os progressos realizados antes da espera e a chamada de ferramenta intencionalmente negada permanecem visíveis. O contrato métrico não recompensa o teatro de conclusão nem pede uma pausa correta. Este experimento é um contra exemplo, não um ponto de referência. Os preços, os testes e os limiares são construídos para testar a regra contabilística. Não estimam uma taxa de falso sucesso da produção e o $0.60 não é um orçamento universal. Evidência de porta antes de otimizar a qualidade Aplicar as métricas em ordem fixa: 1. Check coverage. Toda conclusão declarada precisa de um veredicto de resultado ou um estado explícito não disponível. Cada tentativa de ferramenta que produz efeitos necessita de provas verificadas, falhadas ou desconhecidas de destino. 2. Block falso sucesso. Se uma conclusão declarada não conseguir verificar os resultados, interromper a liberação. Investigue o predicado de conclusão, não o estilo de resposta. 3. Block efeitos desconhecidos. Um efeito colateral desconhecido é um limite de incidente. Pergunte o destino ou reconciliar uma chave de idempotency antes de tentar novamente. 4. Check progress and tool floors. Comparar tarefas semelhantes e preservar as esperanças válidas. Uma regressão do progresso ou uma taxa de falha no efeito das ferramentas podem justificar um retrocesso, mesmo quando a qualidade final aumenta. 5. OOptimize qualidade e custo. Apenas agora comparar notas rubricas, latência, tokens e custo por resultado verificado. Isto não é deliberadamente um composto ponderado. Os pesos convidam a negociação entre danos não relacionados: fluência suficiente pode cancelar matematicamente um pagamento duplicado; corridas baratas suficientes podem esconder um relatório faltante. Uma política pode ainda utilizar pesos dentro da rubrica de qualidade da tarefa, mas a cobertura da evidência e os efeitos externos permanecem fora dessa pontuação. Escolha os limiares das consequências do fluxo de trabalho e da linha de base. Um agente de pesquisa de somente leitura pode tolerar um piso de efeito de ferramenta mais baixo porque a maioria das chamadas são reversíveis. Uma publicação, faturamento, mensagem ao cliente ou agente de controlo de acesso devem exigir receitas de destino, idempotencia e um objetivo de zero falha de sucesso para o conjunto de testes abrangido. Relatar os intervalos de confiança quando a contagem de ensaio for grande o suficiente, e mostrar a contagem bruta quando não for. Cinco ensaios são 0/5 , não prova de uma taxa de falha de população zero. Mantenha a avaliação e a saúde da produção ligadas, mas distintas. Os ensaios offline dizem se um candidato sobrevive a cenários conhecidos. A monitorização da produção diz lhe se os horários reais, credenciais, dependências, custos e resultados permanecem saudáveis após a liberação. Uma suíte de passagem é a permissão para a implantação no âmbito declarado, não prova de que futuras corridas não podem falhar. A direção do produto da Sidewisp é colocar o resultado, o progresso, a ferramenta, a disponibilidade, a memória e a evidência de custo em uma visão de saúde em torno dos tempos de execução dos agentes existentes. Não é um tempo de execução de substituição, gateway obrigatório ou fixador autônomo. A Sidewisp está atualmente em prévia privada. O site público e a biblioteca de artigos estão ao vivo; coleção de agentes de produção saúde, adaptadores de tempo de execução, análise de custos de tokens e execução de recuperação geralmente não são enviados. Use o contrato de cinco métricas em um fluxo de trabalho consecuente primeiro. Se a versão com a média mais bonita ainda falhar em um resultado ou porta de efeito de ferramenta, as métricas fizeram o seu trabalho.