2026-08-01T15:00:26.322Z
Estrutura de teste de agente AI: escolha por evidência, não por contagem de características
Um selector de quatro portas executável compara repetição, efeito ferramenta, memória e evidência de resultado, e então expõe os adaptadores a todas as recomendações que ainda precisam.
Um quadro de ensaio de agentes AIZ deve ser escolhido com base nas evidências que possa reproduzir e verificar, e não no número de métricas no seu catálogo. Para um agente de estado, que usa ferramentas, o primeiro protótipo razoável é a Inspeção AI quando os ambientes descartáveis, a execução de agentes externos e os marcadores de código são centrais. O LangWatch Scenario é o protótipo de melhor forma quando os usuários simulados e o comportamento de várias voltas dominam. MLflow se encaixa em equipes cujos conjuntos de dados de avaliação e histórico de experimentos já são a camada organizadora; DeepEval se encaixa em um fluxo de trabalho de regressão centrado no pytest. Essa é uma ordem protótipo, não um ranking universal. Nenhum desses frameworks sabe se a sua faturada foi criada uma vez, a sua memória sobreviveu a uma reinicialização, ou o seu entrega prometeu é válido. São oráculos de aplicação. Um processo de selecção só é honesto quando indica o trabalho remanescente antes da adoção. Comece com as provas que o quadro deve deixar para trás Os testes de agente não são testes de alargamento imediato. Um agente muda de estado em várias viradas, cruza os limites de permissão, chama ferramentas, espera, retrata e pode terminar com um artefato externo. Uma resposta final fluente é uma observação entre várias. O Guia de Avaliação de Agentes da Anthropic separa a tarefa, os testes, a transcrição, o resultado, o arsenal de avaliação e os classificadores. Também distingue a classificação baseada em código, baseada em modelo e humana. Essa decomposição dá nos uma pergunta de selecção útil: De onde virá cada fato decisivo? Use quatro portas: Portão Requisitos de prova Substituto falso comum Reproduzir O mesmo dispositivo pode restaurar entradas relevantes, estado da ferramenta, permissões e dados de início Reenvio da mesma mensagem Efeito de ferramenta O destino prova que o efeito pretendido ocorreu com a identidade e contagem certas Um rastro diz que a ferramenta foi chamada Continuidade de memória As decisões necessárias sobrevivem ao limite que realmente temem: reiniciar, compactar ou entregar A conversa tem várias viradas. Verificação dos resultados Uma verificação determinista prova que o artefato ou estado prometido existe e é válido O agente diz que acabou. Um quadro pode expor os ganchos para os quatro sem implementar as suas quatro provas. Isso é aceitável. O mau resultado é esconder uma consulta de banco de dados personalizada, reinicialização do dispositivo ou validador de artefatos sob o rótulo vago integração. A distinção é mais importante em dois limites. Uma chamada de ferramenta pode terminar após o destino ter cometido a sua mudança, de modo que o sucesso do transporte e o sucesso do efeito podem discordar. Um teste de várias voltas pode preservar o estado em um processo enquanto o agente implantado perde a mesma decisão após uma reinicialização. Se uma comparação de quadro derrubar qualquer um dos pares, a pontuação não é útil para a confiabilidade do agente. Quatro quadros atuais, ler através desses portões Revistei a documentação oficial atual em 27 de Julho de 2026 e registrei apenas superfícies documentadas. Um nível de custom abaixo não é uma crítica; significa que o quadro fornece um ponto de extensão enquanto a aplicação deve fornecer a verdade. Iinspect AI documenta conjuntos de dados compostos, agentes, ferramentas e marcadores, execução de agentes externos, registros de avaliação e vários backends de sandbox. O seu visão geral oficial usa um agente que age através de ferramentas dentro de uma caixa de areia do Docker. Isso faz com que seja uma forte superfície de partida para tarefas executáveis e com estado. Um marcador personalizado pode inspecionar o ambiente resultante. Ainda precisa de um conector para o destino real e de um oráculo de memória de reinicialização deliberadamente construído. O LangWatch Scenario começa a partir de uma simulação de várias voltas em vez de uma linha estática de entrada e saída. O seu Documentação de simulação de agente mostra expectativas intermediárias de chamada de ferramenta, afirmações personalizadas, como um bilhete criado, testes de recuperação de erros e reprodução de problemas encontrados na produção. Essa forma é atraente para apoio, voz e outros agentes interativos. O estado de conversa documentado não é prova de que uma decisão sobreviveu à morte do processo, e uma afirmação de bilhete ainda é código de inscrição. MLflow organiza a avaliação em torno de conjuntos de dados, funções de previsão, marcadores, resultados de execução, feedback humano e monitoramento. O visão geral da avaliação atual da GenAI torna a pontuação personalizada uma parte de primeira classe de uma corrida de avaliação. Isso é útil quando a equipe já trata conjuntos de dados e linhagem de experiência como sua fonte de verdade. O custo de seleção é o arnês estadual em torno da função de previsão: restaurar um mundo de ferramentas, forçar uma reinicialização e conciliar efeitos externos. O DeepEval oferece testes locais, casos de rotação única e múltipla, limiares, rastreamento e comparação de regressão em um fluxo de trabalho em forma de pytest. O seu arranque rápido é um fácil caminho para equipes que querem avaliações além de testes de aplicação. O quickstart baseia se em métricas baseadas em modelos, por isso uma prova operacional de adequação deve adicionar efeitos deterministas e verificações de resultados em vez de assumir que uma pontuação do juiz prova o estado de destino. Quadro Centro de gravidade documentado O protótipo primeiro quando Adaptadores explícitos para ensaio Inspecção do AI As tarefas, ferramentas, caixas de areia, marcadores executáveis do agente O agente altera os arquivos ou outro estado inspecionável Efeito de destino real; reinicialização da memória Scenário de LangWatch Simulação de várias voltas e afirmações de etapas Comportamento do usuário e caminhos de recuperação conduzem a falhas Efeito de destino real; reinicialização da memória Fluxo ML Setos de dados, marcadores, histórico de execução, feedback Ciclo de vida de avaliação e linhagem já vivem no MLflow Fixação de estado; efeito; memória de reinicialização Profundidade Regressão e rastreamento métricos de estilo pitest A equipa precisa de um ponto de entrada de testes leve. Fixação de estado; efeito; memória de reinicialização; resultado determinista Esta tabela é deliberadamente mais estreita do que uma comparação de produtos. Não diz nada sobre preços de hospedagem, suporte, capacidade de atendimento ou qualquer integração. Responde a uma pergunta: que superfície documentada de execução está mais próxima das provas necessárias para este agente? Execute o selector, e depois desconfia da pontuação. O framework evidence.json acompanhado registra quatro níveis de evidência para cada candidato. 0 significa que não há evidências de origem primária conservadas, 1 significa que é necessário um adaptador ou marcador personalizado explícito e 2 significa que a documentação apresenta um fluxo de trabalho de primeira classe. O cenário de ferramenta com estado representa o peso da repetição em 2 , os efeitos da ferramenta em 4 , a continuidade da memória em 4 e os resultados verificados em 5 . Exibir o artefato: A parte decisiva da produção é: O Inspect e o LangWatch Scenario recebem uma pontuação ponderada de 22 . A inspecção ganha esta fixação apenas porque a carga de trabalho declarada é stateful tool , o que acrescenta um bônus de três pontos. Mudar a carga de trabalho para simulação de várias voltas e a ordem deve mudar. Mudar os pesos e o resultado pode mudar. Essa sensibilidade é uma característica: torna as suposições da equipa revisaveis. A pontuação nunca deve apagar as lacunas. Um resultado que alegasse que o trabalho do adaptador aqui seria menos credível, não mais. A matriz não pode conhecer o esquema do destino, a regra de identidade para um efeito, as decisões que a memória deve reter, ou a regra de validade para o entregue. O artefacto tem também uma dura limitação: é uma auditoria de documentação datada. Não instala os quatro quadros nem mede o tempo de integração. Usá lo para escolher a ordem dos experimentos, depois deixe dois casos inconvenientes decidirem. Falar a prova de adequação de duas maneiras diferentes O primeiro caso testa um efeito de ferramenta ambíguo. Arranjar uma fixação de destino em que a ferramenta comprometa um objeto e o transporte retorna um timeout. O cinto só passa se puder: 1. Manter uma identidade de operação estável através da fronteira de retest; 2. inspecionar o destino em vez de confiar no resultado da chamada; 3. Classificar o Estado como comprometido, não retestá lo cegamente; 4. Mostrar a evidência num registro de execução que um desenvolvedor pode depurar. Os testes de segundo caso reiniciam a continuidade. Deixe o agente escolher um plano limitado, persistir apenas no estado de decisão permitido, terminar seu processo e retomar com um novo processo. O cinto só passa se puder: 1. comprovar que a reinicialização ocorreu; 2. restaurar o mesmo dispositivo sem vazamento do estado de resposta oculta; 3. Verificar a sobrevivência da decisão requerida; 4. Detectar memória obsoleta, ausente ou contraditória; 5. Verificar o artefacto final de forma independente. Incluir uma espera legítima como controlo se o agente solicitar aprovação. Um arame de ensaio que marque cada pausa como falha pressionará o produto a remover os limites de autoridade seguros. A evidência deve distinguir o trabalho, a espera, o atraso e a conclusão, em vez de recompensar a atividade ininterrupta. Caixa tempo o protótipo. Uma pequena equipe não deve construir uma camada de adaptador geral antes de ter reproduzido estas duas falhas. Dê a cada candidato o mesmo dispositivo, o mesmo oráculo de resultados e o mesmo orçamento de depuração. Preferir o quadro que torne a cadeia de provas mais curta e mais inspecionável, mesmo que outro candidato produza métricas mais agregadas. O resultado não é framework X é o melhor. É framework X atinge nossas duas provas duras com estes adaptadores nomeados, e framework Y não está dentro do mesmo orçamento. Essa declaração pode sobreviver a uma revisão de código. As provas de teste não são agentes vivos de saúde A avaliação pré lançamento responde se uma construção pode lidar com tarefas conhecidas e falhas controladas. A saúde ao vivo pergunta se um determinado agente implantado é acessível agora, fazendo progressos úteis, mantendo o contexto necessário, alcançando as suas ferramentas, produzindo o resultado esperado e mantendo se dentro de limites razoáveis de tempo e custo. A aprovação de uma avaliação não prova um agendador disparado ontem à noite, uma credencial é válida hoje, ou um produto de entrega chegou ao seu destino real. O território pretendido do Sidewisp é a camada de saúde em torno dos horários de execução existentes: distinguir o trabalho da espera ou da presença, mostrar evidências e frescura e verificar os resultados antes de resolver um problema. A Sidewisp está atualmente em prévia privada. A experiência pública é um site de acesso precoce e uma demonstração interativa; coleção de agentes de produção e saúde, adaptadores de tempo de execução e recuperação automatizada não são geralmente enviados. Portanto, mantenha os limites explícitos. Use o quadro de ensaio escolhido para tornar visíveis as regressões controladas antes da liberação. Utilize evidências específicas do tempo de execução e verificações de resultados independentes para estabelecer a saúde do vivo após a liberação. Um teste verde é uma prova valiosa, mas não é permissão para tratar um agente não observado como saudável.