2026-08-01T14:17:55.864Z

Metriques d'évaluation de l'agent AI: cinq signaux, aucun score composé

Utilisez cinq dénominateurs explicites et des portes d'épreuves solides pour comparer les libérations d'agents sans cacher le faux succès, les effets des outils inconnus ou les échecs coûteux.

Les mesures d'évaluation des agents AI doivent répondre à une question de libération, et non décorer un tableau de bord. Pour un agent utilisateur d'outils, un défaut compact est cinq mesures maintenues séparément: la qualité de la tâche, les progrès utiles, l'intégrité de l'effet de l'outil, le coût par résultat vérifié et le taux de faux succès. Enregistrer la couverture des preuves à côté de chacun. Ensuite, faites les résultats manquants et les effets des outils inconnus des portes dures avant d'optimiser les moyennes. L'ordre est important. Un candidat peut écrire une meilleure prose, terminer plus rapidement, et paraître moins cher par course tout en produisant un produit non vérifié. La moyenne de ces signaux en un seul score transforme une libération dangereuse en une amélioration numérique. Gardez cinq dénominateurs au lieu d' un score L'évaluation de l'agent a plus d'un objet d'intérêt. Guide d'ingénierie d'Anthropic sur les évaluations des agents distingue les tâches, les essais répétés, les notes, les transcriptions et l'état final de l'environnement. Son exemple de réservation de vol est la limite utile: la transcription peut indiquer qu'un vol a été réservé, tandis que le résultat est de savoir si la réservation existe dans la base de données. Le Description de l'évaluation de l'agent Vertex AI actuel fait une autre séparation. L'évaluation de la réponse finale demande si l'agent a atteint l'objectif; les métriques de trajectoire inspectent le parcours, y compris les correspondances exactes ou ordonnées d'action, la précision, le rappel et l'utilisation d'un seul outil. Les deux points de vue sont utiles, mais l'un ne doit pas se substituer silencieusement à l'autre. Utilisez ce contrat à cinq mètres: La métrique Numérateur Désignateur Conserver séparément Rôle de libération Qualité des tâches Summe des scores de qualité de rubrique ou déterministe en version Des essais pour lesquels le gradant de qualité a réellement couru Révision de l'évaluation, couverture, désaccord Optimiser après que des preuves solides soient passées Des progrès utiles fenêtres d'observation actives avec un delta de données de preuve spécifique à la tâche fenêtres actives observées Les fenêtres d'attente explicites et les collectionneurs obsolètes Le plancher, puis l'optimiser L'intégrité de l'effet outil Effets externes vérifiés à la destination Tentatives d'effets non connus vérifiées + échouées Appels délibérément refusés, effets inconnus Plancher dur Coût par résultat vérifié Coût total de fonctionnement couvert Résultats vérifiés par destination Coût estimé, couverture de facturation manquante Plan budgétaire et optimisation Taux de faux succès Les achats déclarés dont le contrôle des résultats a échoué Toutes les réalisations déclarées Compléments dont le vérificateur n'était pas disponible Le veto est difficile Chaque dénominateur empêche un mensonge différent. La qualité moyenne sans couverture de classe récompense les exemples les plus faciles. Le succès de l'outil sans preuve de destination confond un appel réussi avec un effet réussi. Le coût par course récompense les échecs bon marché. Le taux d'achèvement récompense un agent pour avoir évalué sa propre réclamation. La télémétrie opérationnelle est toujours dans le registre. Le OpenTelemetry Rappel des mesures génAI fixé définit les instruments d'état de développement pour l'utilisation des jetons, la durée d'exploitation, la durée de l'agent, le nombre d'appels d'inférence, le nombre d'appels d'outils et la durée de l'outil. Ces mesures expliquent la charge de travail et l'efficacité. Ils ne prétendent pas qu'un dossier existe, qu'une facture a été créée une fois ou qu'un rapport prévu a atteint sa destination. Écrire le dossier des preuves avant de choisir les seuils Commencez par une rangée par procès. Ne commencez pas par un graphique global. Un enregistrement minimal a besoin de suffisamment d'informations pour reproduire chaque numérateur, dénominateur, exclusion et état non disponible: La valeur importante n'est pas 0.90 ; c'est le désaccord qui l'entoure. Le calificateur de réponse a apprécié la sortie, mais le vérificateur de résultats n'était pas disponible et l'effet de l'outil est resté inconnu. Cet essai peut vous apprendre la qualité de la réponse. Il ne peut pas appuyer une demande de libération. Utilisez trois états de preuve lorsque l'absence est possible: verified signifie que le prédicat nommé a couru contre la destination prévue et a passé. failed signifie que le prédicat a fonctionné et que l'état attendu était absent ou inacceptable. unavailable signifie qu'aucun verdict n'a été possible parce que le vérificateur, le collecteur, l'autorisation ou les preuves de destination manquent. Ne convertissez pas unavailable en zéro ou en succès. Zéro est une mesure; non disponible est un défaut de couverture. L'attente a besoin de soins similaires. Une course avec un propriétaire explicite d'approbation, la décision demandée, la date limite et l'état réalisable ne sont pas bloqués. Comptez les progrès utiles pendant les fenêtres actives avant l'attente, puis arrêtez l'horloge de progression active. Gardez l'appel à l'outil à fort impact rejeté comme preuve que la limite a fonctionné; ne considérez pas un rejet intentionnel comme une défaillance de l'outil. La qualité des tâches est la seule métrique susceptible d'avoir besoin de plusieurs types de classeurs. Utilisez des tests déterministes pour les champs structurés, les fichiers, les lignes de base de données, l'état HTTP et les conditions exactes de la politique. Un modéliseur peut noter le ton, la pertinence ou un artefact sans fin, mais stocker son prompt, le modèle, la version rubrique et l'échantillon d'étalonnage. L'examen humain reste nécessaire lorsque le jugement est conséquent ou que le taux de désaccord du modéliste n'est pas compris. Reproduire l'inversion de libération L'artefact conservé avec cet article contient dix essais synthétiques: cinq pour stable v1 et cinq pour fast v2 . L' exécuter avec Node.js 20 ou plus récent: Les seuils déclarés sont les suivants: Le résumé exact est le suivant: Une variante Qualité Des progrès utiles Effets de l'outil vérifiés Coût / coût Coût / résultat vérifié Faux succès Complète non vérifiée Porte : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 Passage fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 Échec Trois observations modifient la décision. Tout d'abord, fast v2 semble moins cher quand le dénominateur est courant: 0,38 $ au lieu de 0,41 $. Une fois que les dépenses sont divisées par des résultats vérifiés, la conclusion est inversée: 0,63 $ au lieu de 0,52 $. La version plus rapide a dépensé moins pour chaque tentative et plus pour chaque résultat en qui vous pouviez faire confiance. Deuxièmement, le score de qualité supérieur de 0,902 ne répare pas un résultat manquant. Une finition polissée a échoué à vérifier son environnement; une autre n'avait pas de vérificateur utilisable. Les moyennes de qualité et de progrès utiles restent diagnostiques, mais elles ne sont pas autorisées à publier, payer, envoyer des messages, supprimer ou accepter autrement un effet externe. Troisièmement, le stable v1 contient une attente légitime d'approbation. Il est absent du dénominateur de qualité de l'essai terminé, mais les progrès réalisés avant l'attente et l'appel à l'outil délibérément refusé restent visibles. Le contrat métrique ne récompense ni ne punit une pause correcte. Cette expérience est un contre exemple, pas une référence. Les prix, les essais et les seuils sont conçus pour tester la règle comptable. Ils n'estiment pas un taux de faux succès de la production et $0.60 n'est pas un budget universel. Les preuves de la porte avant d'optimiser la qualité Appliquer les indicateurs dans un ordre fixe: 1. Check coverage. Chaque réalisation déclarée a besoin d'un verdict de résultat ou d'un état explicitement indisponible. Chaque tentative d'outil ayant des effets nécessite des preuves de destination vérifiées, ratées ou inconnues. 2. Block faux succès. Si une réalisation déclarée a échoué à vérifier ses résultats, arrêtez la libération. Enquêtez sur le prédicat de finition, pas sur le style de réponse. 3. Block effets inconnus. Un effet secondaire inconnu est une limite d'incident. Recherchez la destination ou réconcilier une clé d'idempotence avant de réessayer. 4. Vérifiez les progrès et les étages des outils. Comparer des tâches similaires et préserver des attentes valides. Une régression de la progression ou un taux d'effet d'outil raté peuvent justifier un retrait même lorsque la qualité finale augmente. 5. O Optimiser la qualité et le coût. Comparer seulement maintenant les scores de rubrique, la latence, les jetons et le coût par résultat vérifié. Il ne s'agit pas délibérément d'un composé pondéré. Les poids invitent à la négociation entre les dommages non liés: une fluidité suffisante peut annuler mathématiquement un paiement en double; des courses bon marché suffisantes peuvent cacher un rapport manquant. Une politique peut encore utiliser des poids dans la rubrique qualité des tâches, mais la couverture des preuves et les effets externes restent en dehors de ce score. Choisissez des seuils à partir des conséquences du flux de travail et de la ligne de base. Un agent de recherche à lecture seule peut tolérer un niveau inférieur de l'effet des outils parce que la plupart des appels sont réversibles. Une publication, une facturation, un message client ou un agent de contrôle d'accès devraient nécessiter des reçus de destination, une idempotence et un objectif de faux succès zéro pour la suite de tests couverte. Indiquer les intervalles de confiance lorsque le nombre d'essais est suffisamment grand et indiquer le nombre brut lorsqu'il n'est pas. Cinq essais sont 0/5 , pas la preuve d'un taux d'échec de la population zéro. Garder l'évaluation et la santé de la production connectées mais distinctes. Des essais hors ligne vous indiquent si un candidat survit à des scénarios connus. La surveillance de la production vous indique si les horaires réels, les informations d'identification, les dépendances, les coûts et les résultats restent sains après la sortie. Une suite passante est une autorisation de déploiement dans le cadre déclaré, et non une preuve que les futures courses ne peuvent pas échouer. L'orientation du produit de Sidewisp est de mettre les résultats, les progrès, les outils, la disponibilité, la mémoire et les preuves de coûts dans une seule vue de la santé autour des temps d'exécution des agents existants. Il ne s'agit pas d'un temps de fonctionnement de remplacement, d'une passerelle obligatoire ou d'un fixateur autonome. Sidewisp est actuellement en préversion privée. Le site public et la bibliothèque d'articles sont en direct; la collection de l'agent de production santé, les adaptateurs de temps d'exécution, l'analyse des coûts des jetons et l'exécution de récupération ne sont généralement pas expédiés. Utilisez d'abord le contrat à cinq mesures sur un flux de travail conséquent. Si la version avec la moyenne la plus attrayante échoue toujours dans un résultat ou une porte d'effet outil, les mesures ont fait leur travail.