2026-08-01T14:17:47.007Z

LLM Autoevaluación: Calibra al juez antes de confiar en él

Envía cada veredicto a pruebas deterministas, un juez calibrado LLM específico de criterios, o una revisión humana responsable.

La autoevaluación de LLM es útil cuando el criterio es genuinamente cualitativo, el evaluador ha sido probado con etiquetas humanas para ese criterio exacto y su respuesta se trata como evidencia de apoyo. No debe decidir si existe un expediente, un pago realizado, un examen aprobado o una persona autorizada a una acción irreversible. Esas preguntas ya tienen dueños más fuertes: controles deterministas o humanos responsables. Por lo tanto, el defecto práctico es un router, no un juez universal. Envía reclamaciones verificables mecánicamente al código. Enviar criterios cualitativos limitados a un evaluador calibrado del modelo. Envía decisiones descubiertas, inestables o de gran impacto a una persona. Si faltan pruebas, mantenga el veredicto unknown . Un juez LLM puede ser útil sin ser autoritario La autoevaluación significa pedirle a un LLM que evalúe su propia producción o la producción de otro modelo. Un segundo paso puede detectar una contradicción obvia, comparar dos resúmenes o calificar una respuesta en función de una rúbrica. Aprenda el resumen de Prompting muestra el patrón básico: generar una respuesta, luego pedirle a un modelo que la critique o la revise. La investigación da a este patrón un papel creíble pero limitado. Ren y sus colegas reformuló la autoevaluación abierta como predicciones a nivel de tokens y informó de una mejor precisión de generación selectiva y una correlación más fuerte con la calidad de salida en TruthfulQA y TL;DR para sus configuraciones de PaLM 2 y GPT 3 probadas. Un estudio más reciente de tareas en múltiples etapas encontró que autoevaluación gradual superó el puntaje holístico para la detección de fallos en dos conjuntos de datos de referencia, con un aumento relativo de hasta un 15% en el AUC ROC. Ninguno de los resultados convierte una opinión modelo en un recibo de entrega. Muestran que la autoevaluación puede mejorar una decisión en función de tareas específicas, instrucciones, modelos y conjuntos de datos. La unidad de confianza es la configuración del evaluador probado, no la frase "LLM juez". También hay modos de falla conocidos. El artículo MT Bench y Chatbot Arena informa que los jueces fuertes llegaron a más del 80% de acuerdo con las preferencias humanas en su entorno, mientras documentaban la posición, la verbosidad, el autoempleo y los prejuicios de razonamiento. El acuerdo es alentador; la lista de sesgos es decisiva desde el punto de vista operativo. Un juez puede ser útil en promedio y aun así revertir el único veredicto que importa. El sesgo de posición es fácil de probar. Evaluar a los candidatos A y B, cambiar su orden sin cambiar su contenido, y evaluar de nuevo. Wang y sus colegas mostró que los cambios de orden podrían alterar sustancialmente los rankings en pares y propuso la calibración de posición equilibrada más la escalada humana. Si el candidato preferido cambia después del intercambio, registre unstable . No promedies la contradicción en una puntuación segura. Congelar el criterio antes de calibrar al juez La "calidad" es demasiado amplia para calibrar. Un juez que reconoce un resumen claro puede seguir siendo poco confiable en el fundamento de los hechos, la interpretación de la política o la suficiencia de pruebas. Definir un criterio con un contrato estrecho: El conjunto de calibración necesita ejemplos que el evaluador no escribió, etiquetas de las personas que poseen el criterio y negativos suficientes como para exponer calificaciones halagadoras o demasiado permisivas. Congelar el identificador de modelo, la llamada de juez, la rúbrica, los ejemplos, el analizador de salida y el umbral juntos. Un cambio en cualquiera de ellos crea una nueva versión evaluadora. Las etiquetas humanas no son una vergüenza en este proceso; definen el objetivo. Los autores de EvalGen describe la "drift de criterios": las personas a menudo refinan lo que quieren decir con un criterio después de ver resultados reales. Esa es una razón para los criterios de versión y las etiquetas, no una razón para ocultar el juicio detrás de una puntuación del modelo. Medir al menos estas propiedades por criterio: el acuerdo contra las etiquetas humanas extendidas; tasa de falsos resultados, porque un evaluador que apruebe una mala salida crea un falso éxito; Taxa unknown , que revela la falta de cobertura; la estabilidad cuando el orden candidato y el formato cambian de forma irrelevante; la cobertura por lenguaje, familia de tareas, clase de impacto y longitud de salida; los grupos de desacuerdos, conservados como ejemplos para la próxima revisión. No combine criterios no relacionados en un promedio tranquilizador. Supongamos que la claridad tiene un acuerdo del 100%, la fundamentalidad tiene un 75% y la seguridad sólo tiene dos ejemplos etiquetados. Una puntuación mezclada del 88% puede ocultar que no existe una puerta de seguridad defendible. Mantenga las tres filas separadas. Los umbrales son opciones políticas, no constantes de un documento. Un equipo puede aceptar el 80% de acuerdo para una sugerencia de estilo de bajo impacto y requerir pruebas deterministas para un efecto de despliegue. La propiedad importante es que el umbral se congela antes de que el candidato a liberación sea anotado. Reproduce una puerta de calibración El siguiente sistema utiliza cuatro criterios y ocho casos de enrutamiento. Su umbral es deliberadamente simple: al menos tres ejemplos etiquetados por humanos, al menos un 80% de acuerdo y ningún cambio ganador bajo reversión de orden. La regla de decisión es pequeña: Ejecutar el dispositivo completo con: La repetición produce: Dos observaciones son más importantes que los números compactos. En primer lugar, la fijación contiene un documento faltante que el juez llama pass . El router devuelve determinista fail . También contiene una combinación de suma de comprobación que no le gusta al juez; el router devuelve determinista pass . Un modelo puede comentar sobre la presentación, pero no puede anular la evidencia sobre si el objeto prometido existe y coincide. En segundo lugar, la calidad en pareja tiene un acuerdo perfecto en cuatro ejemplos etiquetados, pero cambia su ganador cuando los candidatos intercambian orden. La puerta todavía falla. El acuerdo histórico no excusa una contradicción actual. Esta pequeña repetición no es evidencia de que el 80% sea seguro para su aplicación. Es un patrón inspectable para probar que cada veredicto llegó al propietario de la evidencia correcta. Envía la decisión en vivo al propietario de la evidencia más fuerte Una vez que la calibración haya pasado, la decisión sobre el tiempo de ejecución debe conservar tres carriles. Deterministic lane. Utilice las comprobaciones del sistema de archivos, la validación de esquemas, los resultados de las pruebas, las restricciones de la base de datos, los recibos del proveedor, las firmas, las sumas de comprobación y las lecturas de destino cuando puedan responder directamente a la pregunta. Registrar el valor observado y la frescura. Un comando que salga de cero sólo prueba el contrato de ese comando; verifique el resultado externo previsto por separado. ZLanera de apoyo al juez. Utilice un evaluador fijado para criterios como claridad, relevancia, tono o adhesión a las rúbricas cuando la cobertura de calibración coincida con el caso actual. Mantenga el criterio, la versión del evaluador, el hash de respuesta, la referencia de entrada, el veredicto, la explicación y la versión del conjunto de calibración. El modelo apoya el veredicto; la política circundante decide lo que esa evidencia permite. Cinema de revisión humana. Ruta de alto impacto, nuevos idiomas, familias de tareas descubiertas, inestabilidad de orden, excepciones a las políticas y autoridad irreversible aquí. Incluya las pruebas contradictorias y una pregunta concreta. "Por favor, revisa" es una ruta débil; "El recibo determinista está faltando mientras el juez dice completo¿Puede cerrarse este incidente?" es accionable. Un resultado unknown es útil. Dice que el sistema no puede establecer la reclamación actualmente. Transformar el desconocido en paso simplemente protege un tablero de parecer incompleto. Recalibración a la deriva, no sólo en un calendario Un juez puede derivar cuando el alias de modelo cambia, se edita el prompt, se reordenan los ejemplos, llega un nuevo idioma, las salidas se hacen más largas o el producto comienza a manejar una familia de tareas diferente. Recalibración de los cambios y monitoreo de muestras de desacuerdo en vivo entre las revisiones programadas. Mantenga dos límites visibles: 1. La autoevaluación estima una propiedad cualitativa limitada; no prueba la accesibilidad, el progreso útil, los efectos de las herramientas, la persistencia de la memoria o la existencia entregable. 2. Un evaluador calibrado reduce la carga de revisión; no recibe autoridad humana sobre secretos, gastos, publicación, eliminación u otras acciones irreversibles. El resultado es una forma menos teatral de evaluación de AI. El juez obtiene un trabajo útil, la evidencia determinista mantiene su trabajo más fuerte, y la gente retiene las decisiones que les pertenecen. Sidewisp se encuentra actualmente en versión preliminar privada. Se está desarrollando como una capa de salud alrededor de los tiempos de funcionamiento de los agentes existentes, pero la recopilación y recuperación de los agentes de producción y salud no se envían en el repositorio actual del sitio web. Si este problema de enrutamiento de pruebas coincide con la forma en que opera a los agentes, puede unirse a la lista de espera de vista previa privada sin tratar el artículo como una reclamación de una integración de monitoreo en vivo.