2026-08-01T15:00:27.907Z
Cadre d'essais d'agent AI: choisissez par preuve, pas en comptant les caractéristiques
Un sélecteur à quatre portes exécutable compare la répétition, l'effet outil, la mémoire et les preuves de résultats, puis expose les adaptateurs à toutes les recommandations encore nécessaires.
Un cadre d'essai d'agent AIZ devrait être choisi sur la base des éléments de preuve qu'il peut reproduire et vérifier, et non sur la base du nombre de mesures dans son catalogue. Pour un agent doté d'un état et qui utilise des outils, le premier prototype raisonnable est d'inspecter AI lorsque les environnements jetables, l'exécution par un agent externe et les scoreurs de code sont centraux. LangWatch Scenario est le prototype mieux conçu lorsque les utilisateurs simulés et le comportement multi tours dominent. MLflow s'adapte aux équipes dont les ensembles de données d'évaluation et l'historique des expériences sont déjà la couche d'organisation; DeepEval s'adapte à un flux de travail de régression axé sur le pytest. C'est un ordre prototype, pas un classement universel. Aucun de ces cadres ne sait si votre facture a été créée une fois, votre mémoire a survécu à un redémarrage, ou votre livrable promis est valide. Ce sont des oracles d'application. Un processus de sélection n'est honnête que lorsqu'il nomme les travaux restants avant l'adoption. Commencez par les preuves que le cadre doit laisser derrière lui Les tests d'agent ne sont pas des tests rapides agrandis. Un agent change d'état sur plusieurs tours, franchit les limites des autorisations, appelle des outils, attend, réessaye, et peut finir avec un artefact externe. Une réponse finale fluide est une observation parmi plusieurs. Le guide d'évaluation des agents d'Anthropic sépare la tâche, les essais, la transcription, le résultat, le harnais d'évaluation et les évaluateurs. Il distingue également la classification basée sur le code, sur les modèles et sur l'humain. Cette décomposition nous donne une question de sélection utile: d'où viendra chaque fait décisif ? Utilisez quatre portes: Porte Les preuves requises Un faux substitut commun Répétez Le même appareil peut restaurer les entrées pertinentes, l'état de l'outil, les autorisations et les données de démarrage Envoyer à nouveau la même requête Effect de l'outil La destination prouve que l'effet prévu s'est produit avec l'identité et le nombre corrects Une trace indique que l'outil a été appelé Continuité de mémoire Les décisions requises survivent à la limite que vous craignez réellement: redémarrer, compacter ou remettre La conversation se déroule à plusieurs reprises. Vérification des résultats Une vérification déterministe prouve que l'artefact ou l'état promis existe et est valide. L' agent dit que c' est fini . Un cadre peut exposer les crochets pour les quatre sans mettre en œuvre vos quatre preuves. C'est acceptable. Le mauvais résultat est de cacher une requête de base de données personnalisée, un réglage de redémarrage ou un validateur d'artefact sous l'étiquette vague intégration. La distinction est la plus importante à deux frontières. Un appel à l'outil peut s'arrêter une fois que la destination a effectué son changement, de sorte que le succès du transport et le succès des effets peuvent être en désaccord. Un test à plusieurs tours peut préserver l'état d'un processus alors que l'agent déployé perd la même décision après un redémarrage. Si une comparaison de cadre échoue dans l'une ou l'autre des paires, son score n'est pas utile pour la fiabilité de l'agent. Quatre cadres actuels, lisent à travers ces portes J'ai passé en revue la documentation officielle actuelle le 27 juillet 2026 et n'ai enregistré que des surfaces documentées. Un niveau de "custom" inférieur n'est pas une critique; cela signifie que le cadre fournit un point d'extension tandis que l'application doit fournir la vérité. Iinspect AI documente des ensembles de données composables, des agents, des outils et des scoreurs, l'exécution par un agent externe, les journaux d'évaluation et plusieurs arrière plans de la boîte à sable. Son vue d'ensemble officielle utilise même un agent agissant à travers des outils à l'intérieur d'une boîte à sable Docker. Cela en fait une solide surface de départ pour des tâches exécutables et étatiques. Un marqueur personnalisé peut inspecter l'environnement résultant. Il a encore besoin d'un connecteur vers la destination réelle et d'un oracle délibérément construit pour redémarrer la mémoire. LangWatch Scenario commence par une simulation à plusieurs tours plutôt qu'une ligne d'entrée sortie statique. Son documentation de simulation d'agent présente des attentes intermédiaires d'appel à l'outil, des affirmations personnalisées telles qu'un billet créé, des tests de récupération d'erreur et la reproduction des problèmes trouvés dans la production. Cette forme est attrayante pour le soutien, la voix et d'autres agents interactifs. L'état de conversation documenté n'est pas la preuve qu'une décision a survécu au processus de décès, et une affirmation de billet est toujours le code de demande. MLflow organise l'évaluation autour des ensembles de données, des fonctions de prédiction, des marqueurs, des résultats d'exécution, des commentaires humains et de la surveillance. Le vue d'ensemble de l'évaluation actuelle de la GenAI fait du score personnalisé une partie de première classe d'une course d'évaluation. Ceci est utile lorsque l'équipe traite déjà les ensembles de données et la lignée d'expérimentation comme source de vérité. Le coût de sélection est le harnais d'état autour de la fonction de prédiction: restaurer un monde d'outils, forcer un redémarrage et concilier les effets externes. DeepEval offre des essais locaux, des cas à tour unique et à tour multiple, des seuils, un suivi et une comparaison de régression dans un flux de travail en forme de pytest. Son démarrage rapide est une rampe facile pour les équipes qui veulent des évaluations en plus des tests d'application. Le démarrage rapide s'appuie sur des mesures basées sur des modèles, donc une preuve opérationnelle d'ajustement devrait ajouter des vérifications déterministes d'effet et de résultats plutôt que de supposer qu'un score de juge prouve l'état de destination. Cadre Centre de gravité documenté Prototype d'abord quand Adaptateurs explicites à tester Inspection du AI tâches, outils, boîtes à sable, marqueurs exécutables L'agent modifie les dossiers ou autre état inspectable Effectif de destination réel; redémarrage de la mémoire Scénario de LangWatch Simulation à plusieurs tours et affirmations de pas Le comportement de l'utilisateur et les voies de récupération entraînent des défaillances Effectif de destination réel; redémarrage de la mémoire Flux d'écoulement Ensembles de données, marqueurs, historique d'exécution, rétroaction Le cycle de vie et la lignée d'évaluation sont déjà présents dans MLflow Réglage d'état; effet; mémoire de redémarrage La profondeur Régression et traçage métriques de style Pytest L'équipe a besoin d'un point d'entrée léger. Fixation d'état; effet; mémoire de redémarrage; résultat déterministe Ce tableau est délibérément plus restreint qu'une comparaison de produits. Il ne dit rien sur le prix de l'hébergement, le support, la réactivité des entretiens ou toute intégration. Il répond à une question: quelle surface d'exécution documentée est la plus proche des preuves nécessaires à cet agent ? Faites fonctionner le sélecteur, puis méfiez vous du score. Le framework evidence.json d'accompagnement enregistre quatre niveaux de preuve pour chaque candidat. 0 signifie qu'aucune preuve de source primaire n'a été conservée, 1 signifie qu'un adaptateur ou un scorer personnalisé explicite est nécessaire et 2 signifie que la documentation présente un flux de travail de première classe. Le scénario de l'outil d'état mesure la répétition à 2 , les effets de l'outil à 4 , la continuité de la mémoire à 4 et les résultats vérifiés à 5 . Exécutez l' artefact: La partie décisive de la production est: L'inspecteur et LangWatch Scenario reçoivent tous deux un score pondéré de preuve de 22 . Inspect gagne ce jeu uniquement parce que la charge de travail déclarée est stateful tool , ce qui ajoute un bonus de trois points. Modifiez la charge de travail à la simulation à plusieurs tours et l'ordre devrait changer. Changez les poids et le résultat peut changer. Cette sensibilité est une caractéristique: elle rend les hypothèses de l'équipe révisibles. Le score ne doit jamais effacer les lacunes. Un résultat qui prétendrait que l'adaptateur ne fonctionnerait pas ici serait moins crédible, pas plus. La matrice ne peut pas connaître le schéma de destination, la règle d'identité d'un effet, les décisions que la mémoire doit retenir ou la règle de validité du délivrable. L'artefact a aussi une limite: il s'agit d'un audit de la documentation datée. Il n'installe pas les quatre cadres ni ne mesure le temps d'intégration. Utilisez le pour choisir l'ordre des expériences, puis laissez deux cas inconvenients décider. Faire échouer la preuve de conformité de deux façons différentes Le premier cas teste un effet d'outil ambigu. Organisez un dispositif de destination dans lequel l'outil engage un objet et le transport renvoie ensuite un délai. Le harnais ne passe que s'il peut: 1. maintenir une identité d'exploitation stable au delà de la limite des essais répétitifs; 2. inspecter la destination plutôt que de faire confiance au résultat de l'appel; 3. classer l'État comme engagé et ne pas le réessayer aveuglément; 4. montrer les preuves dans un enregistrement d'exécution un développeur peut débogage. Les tests de deuxième cas redémarrent la continuité. Laissez l'agent choisir un plan limité, persistez seulement l'état de décision autorisé, mettez fin à son processus, et reprenez avec un nouveau processus. Le harnais ne passe que s'il peut: 1. prouver que le redémarrage s'est produit; 2. restaurer le même appareil sans fuite d'état de réponse cachée; 3. vérifier la survie de la décision requise; 4. détecter une mémoire obsolète, manquante ou contradictoire; 5. vérifier indépendamment l'artefact final. Incluez une attente légitime en tant que contrôle si l'agent demande l'approbation. Un harnais d'essai qui marque chaque pause comme une défaillance exercera une pression sur le produit pour qu'il élimine les limites d'autorité sécurisées. Les preuves doivent distinguer le travail, l'attente, le blocage et l'achèvement plutôt que de récompenser l'activité ininterrompue. La boîte à temps du prototype. Une petite équipe ne devrait pas construire une couche d'adaptateur générale avant d'avoir reproduit ces deux défaillances. Donnez à chaque candidat le même fichier, le même oracle de résultat et le même budget de débogage. Préférer le cadre qui rend la chaîne de preuve la plus courte et la plus inspectable, même si un autre candidat produit des mesures plus agrégées. Le résultat n'est pas framework X est le meilleur. C'est framework X atteint nos deux preuves avec ces adaptateurs nommés, et framework Y ne se trouve pas dans le même budget. Cette déclaration peut survivre à une révision du code. Les preuves de test ne sont pas des agents vivants. L'évaluation préalable à la sortie répond à la question de savoir si une construction peut gérer des tâches connues et des défaillances contrôlées. La santé en direct demande si un agent déployé en particulier est accessible maintenant, en faisant des progrès utiles, en gardant le contexte requis, en atteignant ses outils, en produisant le résultat attendu et en restant dans des limites de temps et de coûts raisonnables. Passer une évaluation ne prouve pas qu'un planificateur a été renvoyé hier soir, qu'un certificat est valable aujourd'hui, ou qu'un livrable a atteint sa destination réelle. Le territoire prévu de Sidewisp est cette couche de santé autour des temps d'exécution existants: distinguer le travail de l'attente ou du blocage, montrer la preuve et la fraîcheur, et vérifier les résultats avant de régler un problème. Sidewisp est actuellement en préversion privée. L'expérience publique est un site Web d'accès anticipé et une démonstration interactive; la collecte des agents de production et de la santé, les adaptateurs d'exécution et la récupération automatisée ne sont généralement pas expédiés. Alors gardez les limites explicites. Utilisez le cadre d'essai choisi pour rendre les régressions contrôlées visibles avant la libération. Utilisez des preuves spécifiques à la durée de fonctionnement et des contrôles indépendants des résultats pour établir la santé des personnes vivant après la libération. Un test vert est une preuve précieuse, mais ce n'est pas la permission de traiter un agent déployé non observé comme sain.