2026-08-01T11:10:47.079Z
Em direcção a uma ciência do agente AI Confiabilidade: Auditoria das provas
Transformar as doze métricas do papel em um perfil de evidências inspecionável, e depois adicionar os recibos de saúde ao vivo que uma decisão de implantação ainda precisa.
A leitura operacional curta de Towards a Science of AI Agent Reliability é a seguinte: mantenha o perfil quadridimensional do papel, mas nunca aceite uma fila de doze pontuações sem a evidência que os produziu. Para uma decisão de implantação, adicione também a prova atual de acessibilidade, corridas esperadas, espera de propriedade, efeitos de ferramentas e resultados de destino. Um perfil de referência e uma resposta ao veredicto de saúde em directo relacionam questões diferentes. O Junho de 2026 arXiv v3 papel de Stephan Rabanser e colegas mede a confiabilidade independentemente da precisão da tarefa em bruto. Ele avalia 15 modelos em GAIA e um subconjunto limpo de τ banco, depois decompõe a confiabilidade em consistência, robustez, previsibilidade e segurança. O resultado dos autores é deliberadamente inconveniente: os ganhos de capacidade sobre a janela de liberação estudada não produziram automaticamente ganhos de confiabilidade comparáveis. Isso é útil para um operador, mas só depois de traduzir cada métrica num contrato de evidência. A lista de verificação abaixo faz essa tradução e torna explícito o restante limite de produção. Leia as doze métricas como pedidos de evidências A tabela 2 do documento contém doze métricas. Não são doze pontos de qualidade interchangeáveis. Dimensão Métricas em papel Evidências mínimas a conservar Consistência Resultado; distribuição de trajetória; sequência de trajetória; utilização de recursos Versão de conjunto de tarefas, contagem de execução independente, oráculo de resultados, sequências de ação, unidades de recursos e cada registro por execução Robustez falha; ambiente; urgência Ensaios de linha de base, ensaios perturbados em pares, uma especificação de perturbação versionada e prova de que o ambiente ou a mudança rápida preservaram o significado da tarefa Previsibilidade calibração; discriminação/AUROC; Brier Confiança obtida antes da classificação, evidências de resultados binários, método de classificação ou classificação, conteúdo de amostras e fonte de confiança Segurança conformidade; gravidade do dano Restrições de versão, todas as violações, regras de severidade, identidade e versão do juiz e uma amostra de validação humana A primeira regra operacional é, portanto, simples: a métrica a sem o seu denominador, protocolo e localização da prova não está disponível, não é baixa e não é saudável . Considere a consistência dos resultados. Re exercer quarenta tarefas cinco vezes dá 200 testes, mas uma pontuação sozinha não diz se as mesmas tarefas alternaram entre sucesso e fracasso ou se um subconjunto fixo falhou a cada vez. Esses padrões podem ter uma precisão média semelhante e consequências operacionais muito diferentes. A métrica do papel existe para expor essa distinção; descartar a evidência de nível de ensaio recriaria o problema que resolve. As métricas de robustez precisam de ainda mais cuidado. Uma pontuação de injecção de falha só pode ser interpretada em relação a uma linha de base. Uma pontuação de robustez rápida só é válida se as variantes permanecerem semânticamente equivalentes. Renomear um campo JSON pode testar a fragilidade ambiental; remover as informações necessárias para resolver a tarefa muda a tarefa. Guarde o gerador de perturbação, sua versão e uma amostra revisada ao lado do resultado. A previsibilidade requer um tempo igualmente rigoroso. Capturar confiança antes que o grador de resultados corra. A confiança escrita depois de um agente ter visto um resultado de teste não é uma previsão. Também registar se o valor veio do agente, um modelo separado, um classificador calibrado, ou uma heurística. As pontuações de calibração, AUROC e Brier podem ser calculadas corretamente a partir do sinal de confiança errado. Por último, preserve os limites de segurança do papel. O seu metodologia pública informa a segurança separadamente do índice de confiabilidade agregado. É o padrão certo para as operações. Uma boa pontuação de consistência não deve averiguar uma ação destrutiva não autorizada. As medidas de conformidade indicam a frequência com que as restrições foram respeitadas; a gravidade do prejuízo condicional pergunta a gravidade das violações. Precisas da frequência e da cauda. Limitar o perfil antes de debater os limiares Os argumentos de limiar são prematuros quando o pacote de provas é incompleto. Eu construí um pequeno linter de perfil que primeiro verifica a estrutura: existem todas as doze métricas designadas; Cada métrica possui uma pontuação, um numerador, um denominador, um protocolo e um URI de evidência; Os resultados de robustez incluem as contagens de base e de perturbação em pares, além de uma especificação em versão; Os resultados de previsibilidade identificam a fonte de confiança; Os resultados de segurança identificam as restrições e o método de avaliação; A segurança não é incluída no agregado global de confiabilidade; Uma implantação autónoma inclui uma amostra de segurança não vazia validada pelo ser humano. Em seguida, verifica seis classes de evidências de saúde viva: frescura, acessibilidade, cobertura de cronograma, propriedade de espera, recibos de efeito de ferramenta e recibos de resultado de destino. O perfil ilustrativo incluído contém todas as doze métricas de papel e uma revisão de segurança humana de 30 casos. O resultado é ainda: Os dois bloqueadores não têm receitas de resultado de ferramenta e destino. O ensaio de linter fornece, em seguida, essas duas referências de evidência e altera o resultado para PASS . Isso não prova que o agente fictício é seguro; prova que o manifesto de evidências é completo o suficiente para ser revisado. A distinção importa. Realizar a auditoria com: Este é um artefato deliberadamente modesto. Valida a presença e a forma, não a validade científica. Não pode decidir se um índice de referência representa os seus utilizadores, se um relatório de confiança é honesto, se duas indicações significam a mesma coisa ou se um juiz da LLM classificou corretamente o dano. Estas continuam a ser tarefas de revisão de domínios. Não transformar o perfil em um único número de liberação O papel calcula agregados de dimensões para apoiar a comparação, mas as suas próprias escolhas revelam por que os operadores devem manter o perfil visível. O agregado global de confiabilidade combina consistência, previsibilidade e robustez; a segurança permanece separada. O documento também indica limites importantes: dois índices de referência cobrem apenas uma faixa de tarefa estreita, um andaime é usado por índice de referência, a avaliação da segurança depende de um juiz LLM, as opções métricas e de agregação são subjetivas, e a temperatura zero pode sobreestimar a confiabilidade disponível em configurações escolhidas para maximizar a precisão. Estes limites devem aparecer ao lado de uma decisão de implantação, e não numa nota de metodologia arquivada. Uma revisão prática pode utilizar três camadas: 1. Perfeição do perfil: São as doze métricas corroboradas por evidências verificáveis? 2. Predes de aplicação: Que dimensões e condições de cauda são aceitáveis para esta tarefa e nível de autoridade? 3. O Evidências operacionais: O sistema atualmente implantado é acessível, progride, limita e produz o resultado externo pretendido? A segunda camada é necessariamente específica de aplicação. Um assistente de redacção de projetos com revisão humana obrigatória pode tolerar diferentes inconsistências de um agente de reembolso não supervisionado. O documento faz o mesmo ponto geral: os requisitos de fiabilidade devem ser ampliados com autonomia. Evite copiar uma pontuação da tabela de classificação para um limiar de liberação universal. Para efeitos colaterais consequentes, utilize o veto antes das médias. Uma política local sensata é: Esta ordem mantém as médias atraentes de ocultar estados desconhecidos ou graves. Adicionar as provas de produção que o papel não afirma medir Um índice de referência avalia o comportamento sob um protocolo definido. Um operador também deve saber o que está a acontecer agora. Adicione estes seis recibos sem fingir que são métricas extra de papel: E Freshness Evidence: quando foi verificado pela última vez cada sinal de saúde e quando expira. Reaccionabilidade: se o tempo de execução e as ferramentas necessárias podem ser contatadas agora. Cobertura do cronograma: que iniciaram, concluíram, se sobrepõem ou não foram realizadas. Esperança de propriedade: se uma dependência legítima tem um proprietário, prazo e estado reiniciável. Conciliação de efeitos de ferramenta: Se uma ação temporizada ou repetida mudou o seu destino zero, uma ou várias vezes. Verificação do resultado do destino: se o arquivo prometido, a alteração da base de dados, a mensagem, o resultado do teste ou outro produto entregue existe e satisfaz a sua regra de aceitação. Este adendo evita dois erros de categoria. Em primeiro lugar, o repetido sucesso dos índices de referência não prova que um período de execução da produção seja atualmente alcançável. Em segundo lugar, um comando bem sucedido ou uma resposta modelo não provam que o efeito externo ou o entregue exista. O Repositório de arneses HAL ligado a partir do local do projeto é útil aqui porque enfatiza avaliações reprodutíveis, rastreamentos, isolamento e rastreamento de custos. São fortes dados de avaliação. Eles ainda precisam de um oráculo de resultados específico para a implantação e de recibos operacionais atuais quando o agente atua fora do índice de referência. Use o papel como um perfil, não um boletim de permissão. Para uma revisão real, comece com um fluxo de trabalho em vez de uma frota inteira: 1. Pin o tempo de execução, o modelo, o compromisso do andaime, as versões de ferramentas, a versão do conjunto de tarefas e a data de avaliação. 2. Execute ensaios nominais repetidos e retenha resultados, trajetórias e registros de recursos. 3. Defina a falha, o ambiente e as perturbações imediatas antes de inspecionar o resultado. 4. Capturar confiança antes de classificar. 5. Defina as restrições e os níveis de gravidade; validação humana de uma amostra de segurança. 6. Mantenha a segurança separada do agregado. 7. Anexe as seis aulas de evidências de saúde viva. 8. Regista o unknown onde faltem provas. 9. Estabelecer limiares e direitos de veto para a autoridade e as consequências deste fluxo de trabalho. 10. Reexamine o perfil após mudanças no modelo de material, no prompt, no andaime, na ferramenta ou no ambiente. Isto preserva a principal contribuição do papel: a fiabilidade é uma forma, não um sinônimo de precisão. Também impede que essa forma se torne um painel decorativo. O resultado observável da revisão não é uma pontuação de confiabilidade foi calculada. É uma decisão versionada com evidências verificáveis, incógnitas explícitas e uma lista clara do que deve ser verificado antes da expansão da autoridade. O território pretendido pela Sidewisp é o lado operacional dessa fronteira: acessibilidade, progresso útil, contexto, ferramentas, resultados e custo em torno de agentes que já funcionam em outros lugares. A Sidewisp está atualmente em prévia privada. Os seus adaptadores de monitoramento de produção e sistemas de recuperação geralmente não são enviados, por isso este artigo descreve um método de operação, não uma capacidade atual automatizada de Sidewisp. Se esse limite de provas coincidir com as falhas que você precisa capturar, você pode participar da pré visualização privada do site Sidewisp. Fontes Rabanser et al., Para uma ciência da confiabilidade do agente AI, arXiv v3, Junho 2026 Metodologia de confiabilidade do Leaderboard de Agentes Holísticos Arnes de avaliação HAL reproduzível Página de carta ICML 2026 Registro OpenReview