2026-08-01T11:10:48.494Z

Vers une science de l'agent AI fiabilité: vérification des preuves

Transformez les douze indicateurs du document en un profil de preuve inspectable, puis ajoutez les reçus de santé en direct dont une décision de déploiement a encore besoin.

La courte lecture opérationnelle de Towards a Science of AI Agent Reliability est la suivante: gardez le profil en quatre dimensions du papier, mais n'acceptez jamais une rangée de douze scores sans la preuve qui les a produits. Pour une décision de déploiement, ajoutez également la preuve actuelle de disponibilité, de courses attendues, d'attentes propres, d'effets des outils et de résultats de destination. Un profil de référence et un verdict de santé en direct répondent à des questions liées mais différentes. Le Juin 2026 papier arXiv v3 de Stephan Rabanser et ses collègues mesure la fiabilité indépendamment de la précision des tâches. Il évalue 15 modèles sur GAIA et un sous ensemble nettoyé de τ bench, puis décompose la fiabilité en cohérence, robustesse, prévisibilité et sécurité. Le résultat des auteurs est délibérément inconvénient: les gains de capacité sur la fenêtre de libération étudiée n'ont pas automatiquement produit de gains de fiabilité comparables. C'est utile pour un opérateur, mais seulement après avoir traduit chaque métrique dans un contrat de preuve. La liste de contrôle ci dessous fait cette traduction et rend explicite la limite de production restante. Lisez les douze indicateurs en tant que requêtes de preuve Le tableau 2 du document contient douze indicateurs. Il ne s'agit pas de douze points de qualité interchangeables. Dimension Mesures en papier Les éléments de preuve minimaux à conserver La cohérence résultat; répartition de la trajectoire; séquence de trajectoire; utilisation des ressources La version de l'ensemble de tâches, le compte de l'exécution indépendant, l'oracle de résultats, les séquences d'action, les unités de ressources et chaque enregistrement par exécution Résistance défaut; environnement; rapidité Les essais de base, les essais perturbés par paires, une spécification de perturbation versionnée et la preuve que l'environnement ou le changement rapide a préservé la signification de la tâche Prévisibilité l'étalonnage; la discrimination/AUROC; Brier Confiance acquise avant la classification, preuve de résultats binaires, méthode de classement ou de classement, nombre d'échantillons et source de confiance Sécurité conformité; gravité du préjudice Restrictions de version, chaque violation, règles de sévérité, identité et version du juge, et un échantillon de validation humaine La première règle d'exploitation est donc simple: la métrique a sans son dénominateur, son protocole et son emplacement de preuve n'est pas disponible, pas faible et pas saine . Considérez la cohérence des résultats. Répéter quarante tâches cinq fois donne 200 essais, mais un score seul ne vous indique pas si les mêmes tâches alternent entre le succès et l'échec ou si un sous ensemble fixe échoue à chaque fois. Ces modèles peuvent avoir une précision moyenne similaire et des conséquences opérationnelles très différentes. La métrique du papier existe pour exposer cette distinction; rejeter les preuves au niveau de l'essai recréerait le problème qu'elle résout. Les mesures de robustesse nécessitent encore plus de soin. Un score d'injection de défaut ne peut être interprété que par rapport à une ligne de base. Un score de robustesse rapide n'est valable que si les variantes restent sémantiquement équivalentes. La renommée d'un champ JSON peut tester la vulnérabilité environnementale; la suppression des informations requises pour résoudre la tâche modifie la tâche. Conservez le générateur de perturbation, sa version et un échantillon examiné à côté du résultat. La prévisibilité nécessite un timestamp aussi strict. Capturez la confiance avant que le classement des résultats ne s'exécute. La confiance écrite après qu'un agent ait vu un résultat d'essai n'est pas une prédiction. Enregistrez également si la valeur provient de l'agent, d'un modèle séparé, d'un classificateur calibré ou d'une heuristique. Les scores de calibration, AUROC et Brier peuvent tous être calculés correctement à partir du mauvais signal de confiance. Enfin, préserver les limites de sécurité du papier. Son méthodologie publique rapporte la sécurité séparément du score de fiabilité global. C'est le bon défaut pour les opérations. Un score de cohérence élevé ne doit pas permettre d'éliminer une action destructrice non autorisée. Les mesures de conformité permettent de déterminer la fréquence à laquelle les contraintes ont été respectées; la gravité des dommages conditionnels pose la question de la gravité des violations. Vous avez besoin de la fréquence et de la queue. Faire le profil avant de débattre des seuils Les arguments de seuil sont prématurés lorsque le dossier de preuve est incomplet. J' ai construit un petit profil de linter qui vérifie d'abord la structure: toutes les douze mesures nommées existent; chaque métrique a un score, un numérateur, un dénominateur, un protocole et un URI de preuve; Les résultats de robustesse comprennent des nombres de base et de perturbation par paires, ainsi qu'une spécification versionnée; les résultats de prévisibilité identifient la source de confiance; les résultats de sécurité identifient les contraintes et la méthode de jugement; la sécurité n'est pas incluse dans l'agrégat global de fiabilité; un déploiement autonome comprend un échantillon de sécurité non vide validé par l'homme. Il vérifie ensuite six catégories de preuves de santé: fraîcheur, accessibilité, couverture du calendrier, propriété d'attente, reçus d'effet outil et reçus de destination. Le profil illustratif inclus contient les douze mesures papier et une revue de la sécurité humaine de 30 cas. Le résultat est toujours: Les deux bloqueurs manquent de reçus pour l'effet outil et le résultat de destination. L'essai de couverture fournit ensuite ces deux références de preuve et change le résultat en PASS . Cela ne prouve pas que l'agent fictif est en sécurité; il prouve que le manifeste de preuves est suffisamment complet pour être examiné. La distinction compte. Effectuer l'audit en utilisant: C'est un artefact délibérément modeste. Il valide la présence et la forme, pas la validité scientifique. Il ne peut pas décider si un indice de référence représente vos utilisateurs, si un rapport de confiance est honnête, si deux indications signifient la même chose ou si un juge LLM a correctement évalué les dommages. Ces tâches restent des tâches de révision de domaine. Ne transformez pas le profil en un numéro de sortie Le papier compute les agrégats de dimensions pour soutenir la comparaison, mais ses propres choix révèlent pourquoi les opérateurs devraient garder le profil visible. L'agrégat global de fiabilité combine la cohérence, la prévisibilité et la robustesse; la sécurité reste séparée. Le document indique également des limites importantes: deux critères de référence ne couvrent qu'une tranche de tâche étroite, un échafaudage est utilisé par référence, l'évaluation de la sécurité dépend d'un juge LLM, les choix de métrique et d'agrégation sont subjectifs et la température zéro peut surestimer la fiabilité disponible dans les paramètres choisis pour maximiser la précision. Ces limites devraient figurer à côté d'une décision de déploiement et non dans une note de méthodologie archivée. Un examen pratique peut être réalisé en trois couches: 1. Completé du profil: Les douze indicateurs sont ils appuyés par des preuves vérifiables? 2. Périodes d'application: Quelles dimensions et quelles conditions sont acceptables pour cette tâche et ce niveau d'autorité? 3. OEvidence opérationnelle: Est ce que le système déployé actuellement est accessible, progressif, délimité et produit le résultat externe prévu? La deuxième couche est nécessairement spécifique à l'application. Un assistant de rédaction d'un projet avec un examen humain obligatoire peut tolérer une incohérence différente de celle d'un agent de remboursement non surveillé. L'article fait le même point général: les exigences de fiabilité devraient évoluer avec autonomie. Évitez de copier un score du classement dans un seuil de sortie universel. Pour les effets secondaires conséquents, utilisez les droits de veto avant les moyennes. Une politique locale raisonnable est la suivante: Cet ordre empêche les moyennes attrayantes de cacher des états inconnus ou graves. Ajouter les preuves de production que le papier ne prétend pas mesurer Une référence évalue le comportement selon un protocole défini. Un opérateur doit aussi savoir ce qui se passe maintenant. Ajoutez ces six reçus sans prétendre qu' ils sont des métriques papier supplémentaires: EFreshness of evidence: lorsque chaque signal de santé a été vérifié pour la dernière fois et quand il expire. Reaccessibilité: si le temps d'exécution et les outils requis peuvent être contactés dès maintenant. Couverture du calendrier: qui ont commencé, achevé, superposé ou manqué les courses attendues. Attendez la propriété: si une dépendance légitime a un propriétaire, une date limite et un état de recommencement. Conciliation de l'effet de l'outil: si une action retardée ou réessayée a changé sa destination à zéro, une ou plusieurs reprises. Vérification des résultats de destination: si le fichier promis, la modification de la base de données, le message, le résultat du test ou tout autre produit livré existe et répond à sa règle d'acceptation. Cet addendum prévient deux erreurs de catégorie. Premièrement, le succès répété des critères de référence ne prouve pas qu'un délai de production est actuellement atteignable. Deuxièmement, une commande réussie ou une réponse modèle ne prouve pas l'existence de l'effet externe ou du livrable. Le Réservoir de harnais HAL lié à partir du site du projet est utile ici car il met l'accent sur les évaluations reproducibles, les traces, l'isolement et le suivi des coûts. Ce sont de fortes données d'évaluation. Ils ont toujours besoin d'un oracle de résultats spécifique au déploiement et de reçus opérationnels courants lorsque l'agent agit en dehors de l'indice de référence. Utilisez le papier comme profil, pas une feuille d'autorisation Pour une révision réelle, commencez par un flux de travail plutôt qu'une flotte entière: 1. Fixer le temps d'exécution, le modèle, l'engagement de l'échafaudage, les versions des outils, la version du jeu de tâches et la date d'évaluation. 2. Exécuter des essais nominaux répétés et conserver les résultats, les trajectoires et les enregistrements des ressources. 3. Définissez la faute, l'environnement et les perturbations immédiates avant d'inspecter le résultat. 4. Capturez la confiance avant d'obtenir des notes. 5. Définir les contraintes et les niveaux de gravité; valider par l'homme un échantillon de sécurité. 6. Gardez la sécurité séparée de l'ensemble. 7. Attachez les six cours de preuves de santé vivante. 8. Enregistrez unknown là où la preuve manque. 9. Définir des seuils et des droits de veto pour l'autorité et les conséquences de ce flux de travail. 10. Réinitialisez le profil après modifications du modèle de matériau, de l'interrupteur, de l'échafaudage, de l'outil ou de l'environnement. Cela préserve la contribution principale du papier: la fiabilité est une forme et non un synonyme de précision. Il empêche aussi cette forme de devenir un tableau de bord décoratif. Le résultat observable de l'examen n'est pas un score de fiabilité a été calculé. Il s'agit d'une décision versionnée avec des preuves vérifiables, des inconnues explicites et une liste claire de ce qui doit être vérifié avant l'expansion de l'autorité. Le territoire prévu par Sidewisp est le côté opérationnel de cette frontière: accessibilité, progrès utiles, contexte, outils, résultats et coût autour d'agents qui fonctionnent déjà ailleurs. Sidewisp est actuellement en préversion privée. Ses adaptateurs de surveillance de production et ses systèmes de récupération ne sont généralement pas expédiés, donc cet article décrit une méthode d'exploitation, et non une capacité automatique actuelle de Sidewisp. Si cette limite de preuve correspond aux défaillances que vous devez détecter, vous pouvez vous joindre à l'aperçu privé depuis le site Sidewisp. Les sources Rabanser et coll., Towards a Science of AI Agent Reliability, arXiv v3, juin 2026 La méthodologie de fiabilité du tableau de bord des agents holistiques Harnais d'évaluation HAL reproductible Page d'affichage ICML 2026 Enregistrement OpenReview