2026-08-01T14:17:49.133Z
LLM Auto-évaluation: Calibrez le juge avant de lui faire confiance
Chaque verdict est dirigé vers des preuves déterministes, un juge LLM calibré spécifique aux critères, ou un examen humain responsable.
L'auto évaluation LLM est utile lorsque le critère est véritablement qualitatif, que l'évaluateur a été testé contre des étiquettes humaines pour ce critère exact et que sa réponse est considérée comme une preuve justificative. Il ne devrait pas décider si un dossier existe, si un paiement a été effectué, si un test a été passé ou si une personne a autorisé une action irréversible. Ces questions ont déjà des propriétaires plus forts: des contrôles déterministes ou des humains responsables. Le défaut pratique est donc un routeur, pas un juge universel. Envoyez des réclamations vérifiables mécaniquement au code. Envoyer des critères qualitatifs limités à un évaluateur de modèle calibré. Envoyez à une personne des décisions non révélées, instables ou à fort impact. Si les preuves manquent, gardez le verdict unknown . Un juge LLM peut être utile sans être autoritaire L'auto évaluation signifie demander à un LLM d'évaluer sa propre puissance ou celle d'un autre modèle. Un deuxième passage peut détecter une contradiction évidente, comparer deux résumés ou classer une réponse par rapport à une rubrique. Découvrez le récit de Prompting montre le modèle de base: générer une réponse, puis demander à un modèle de la critiquer ou de la réviser. Les recherches donnent à ce modèle un rôle crédible mais limité. Ren et ses collègues a réformé l'auto évaluation à terme en tant que prédictions au niveau des jetons et a rapporté une meilleure précision de génération sélective et une corrélation plus forte avec la qualité de sortie sur TruthfulQA et TL;DR pour leurs paramètres testés PaLM 2 et GPT 3. Une étude plus récente sur les tâches en plusieurs étapes a révélé que l'auto évaluation étape par étape avait dépassé la notation holistique pour la détection des défaillances sur deux ensembles de données de référence, avec une augmentation relative de 15% de l'AUC ROC. Aucun des deux résultats ne transforme un modèle d'avis en reçu de livraison. Ils montrent que l'auto évaluation peut améliorer une décision dans le cadre de tâches spécifiques, d'instructions, de modèles et d'ensembles de données. L'unité de confiance est la configuration de l'évaluateur testée, pas la phrase "Juge LLM". Il existe également des modes de défaillance connus. Le journal MT Bench et Chatbot Arena rapporte que des juges forts ont atteint plus de 80% d'accord avec les préférences humaines dans son cadre, tout en documentant la position, la verbosité, l'auto amélioration et les biais de raisonnement. L'accord est encourageant; la liste des préjugés est opérationnellement décisive. Un juge peut être utile en moyenne et toujours renverser le verdict qui compte. Le biais de position est facile à tester. Évaluer les candidats A et B, échanger leur commande sans modifier leur contenu, et évaluer à nouveau. Wang et ses collègues a montré que les changements d'ordre pouvaient modifier de manière significative les classements par paires et a proposé une calibration de position équilibrée plus une escalade humaine. Si le candidat préféré change après l'échange, enregistrer unstable . Ne donnez pas à la contradiction une note sûre. Congeler le critère avant de calibrer le juge La "qualité" est trop large pour être calibrée. Un juge qui reconnaît un résumé clair peut encore être peu fiable sur la base des faits, l'interprétation des politiques ou la suffisance des preuves. Définir un critère avec un contrat restreint: L'ensemble d'étalonnage a besoin d'exemples que l'évaluateur n'a pas écrits, d'étiquettes de la part des personnes qui possèdent le critère et de négatifs suffisamment difficiles pour exposer des notations flatteuses ou trop permissives. Fermez l'identifiant du modèle, le prompt de jugement, la rubrique, les exemples, le parseur de sortie et le seuil ensemble. Un changement à l'un d'eux crée une nouvelle version d'évaluation. Les étiquettes humaines ne sont pas une gêne dans ce processus; elles définissent la cible. Les auteurs d'EvalGen décrit la "dérive des critères": les gens affinent souvent ce qu'ils veulent dire par un critère après avoir vu des résultats réels. Il s'agit là d'une raison pour les critères de version et les étiquettes, pas pour cacher le jugement derrière un score de modèle. Mesurer au moins ces propriétés par critère: l'accord contre les étiquettes humaines retenues; taux de faux pass, car un évaluateur qui approuve une mauvaise sortie crée un faux succès; taux unknown , qui révèle une couverture manquante; la stabilité lorsque l'ordre des candidats et la mise en forme sont modifiées de manière irrélevante; couverture par langage, famille de tâches, classe d'impact et longueur de sortie; les groupes de désaccords, conservés comme exemples pour le prochain examen. Ne combinez pas de critères non liés dans une moyenne rassurante. Supposons que la clarté soit 100% d'accord, que la solidité soit 75% et que la sécurité n'ait que deux exemples étiquetés. Un score mixte de 88% peut dissimuler qu'il n'existe pas de porte de sécurité défendable. Gardez les trois rangées séparées. Les seuils sont des choix politiques, pas des constantes d'un document. Une équipe peut accepter 80% d'accord pour une suggestion de style à faible impact et exiger une preuve déterministe pour un effet de déploiement. La propriété importante est que le seuil est gelé avant que le candidat de libération soit marqué. Répétez une passerelle d'étalonnage Le dispositif suivant utilise quatre critères et huit cas de routage. Son seuil est délibérément simple: au moins trois exemples étiquetés par l'homme, au moins 80% d'accord, et aucun changement gagnant dans l'inversion de l'ordre. La règle de décision est petite: Exécutez l' appareil complet avec: La répétition produit: Deux observations comptent plus que les chiffres compacts. Tout d'abord, l'appareil contient un délivrable manquant que le juge appelle pass . Le routeur renvoie fail déterministe. Il contient également une correspondance de la somme de contrôle que le juge n'aime pas; le routeur renvoie pass déterministe. Un modèle peut commenter la présentation, mais il n'arrive pas à annuler les preuves quant à l'existence et à la correspondance de l'objet promis. Deuxièmement, la qualité par paire est parfaitement d'accord sur quatre exemples étiquetés mais change son gagnant lorsque les candidats échanger l'ordre. La porte est toujours en panne. L'accord historique n'excuse pas une contradiction actuelle. Cette petite répétition n'est pas une preuve que 80% est sûr pour votre application. C'est un modèle inspectable pour prouver que chaque verdict a atteint le propriétaire de la preuve correcte. Envoyez la décision en direct au plus fort propriétaire de la preuve Une fois l'étalonnage passé, la décision d'exécution devrait préserver trois voies. Deterministic lane. Utilisez les contrôles du système de fichiers, la validation des schémas, les résultats des tests, les contraintes de base de données, les reçus du fournisseur, les signatures, les montants de contrôle et les lectures de destination lorsqu'ils peuvent répondre directement à la question. Enregistrez la valeur et la fraîcheur observées. Une commande sortant de zéro ne prouve que le contrat de cette commande; vérifiez séparément le résultat externe prévu. La voie du soutien du juge. Utilisez un évaluateur fixe pour déterminer des critères tels que la clarté, la pertinence, le ton ou l'adhésion à la rubrique lorsque la couverture de calibration correspond au cas actuel. Conserver le critère, la version de l'évaluateur, le hash prompt, la référence d'entrée, le verdict, l'explication et la version de l'étalonnage. Le modèle soutient le verdict; la politique environnante décide de ce que ces preuves permettent. Lanne d'examen humain. Route des désaccords à fort impact, de nouvelles langues, des familles de tâches découvertes, de l'instabilité de l'ordre, des exceptions à la politique et une autorité irréversible ici. Incluez les preuves contradictoires et une question concrète. "S'il vous plaît réviser" est un routage faible; "La réception déterministe est manquante alors que le juge dit complètepuis je fermer cet incident?" est actionable. Un résultat unknown est utile. Il indique que le système ne peut pas établir la revendication actuellement. Transformer l'inconnu en passe protège simplement un tableau de bord de ne pas paraître incomplet. Récalibrer à la dérive, pas seulement sur un calendrier Un juge peut dériver lorsque le nom du modèle change, que le prompt est modifié, que les exemples sont réorganisés, qu'un nouveau langage arrive, que les sorties deviennent plus longues ou que le produit commence à gérer une famille de tâches différente. Réinitialiser la réétalonnage de ces changements et surveiller les échantillons en direct de désaccords entre les examens programmés. Gardez deux limites visibles: 1. L'auto évaluation évalue une propriété qualitative limitée; elle ne prouve pas la facilité d'accès, le progrès utile, les effets des outils, la persistance de la mémoire ou l'existence livrable. 2. Un évaluateur calibré réduit la charge de révision; il ne reçoit pas l'autorité humaine sur les secrets, les dépenses, la publication, la suppression ou d'autres actions irréversibles. Le résultat est une forme moins théâtrale d'évaluation de AI. Le juge obtient un emploi utile, les preuves déterministes conservent leur emploi plus fort, et les gens conservent les décisions qui leur appartiennent. Sidewisp est actuellement en préversion privée. Il est en cours de développement comme une couche de santé autour des temps d'exécution existants des agents, mais la collecte et la récupération des agents de production et de la santé ne sont pas expédiées dans le référentiel du site Web actuel. Si ce problème de routage des preuves correspond à la façon dont vous exploitez les agents, vous pouvez rejoindre la liste d'attente d'aperçu privé sans traiter l'article comme une revendication d'une intégration de surveillance en direct.