2026-08-01T11:10:46.338Z

Hacia una ciencia del agente AI Confiabilidad: auditoría de la evidencia

Convierten las doce métricas del documento en un perfil de evidencia inspectables, luego añaden los recibos de salud en vivo que una decisión de despliegue aún necesita.

La lectura operativa corta de Hacia una ciencia de AI Agente de confiabilidad es la siguiente: mantener el perfil de papel en cuatro dimensiones, pero nunca aceptar una fila de doce puntuaciones sin la evidencia que las produjo. Para una decisión de despliegue, agregue también la prueba actual de accesibilidad, carreras esperadas, espera de propiedad, efectos de herramientas y resultados de destino. Un perfil de referencia y una respuesta en vivo del veredicto de salud se relacionan, pero son preguntas diferentes. El Junio 2026 documento arXiv v3 de Stephan Rabanser y sus colegas mide la fiabilidad independientemente de la precisión de la tarea en bruto. Evalúa 15 modelos en GAIA y un subconjunto limpio de τ bench, luego descompone la fiabilidad en consistencia, robustez, previsibilidad y seguridad. El resultado de los autores es deliberadamente inconveniente: las ganancias de capacidad sobre la ventana de liberación estudiada no produjeron automáticamente ganancias de fiabilidad comparables. Esto es útil para un operador, pero sólo después de traducir cada métrica en un contrato de prueba. La lista de verificación a continuación hace esa traducción y hace explícito el límite restante de producción. Lea las doce métricas como peticiones de evidencia La tabla 2 del documento contiene doce métricas. No son doce puntos de calidad intercambiables. Dimensión Métricas en papel Evidencias mínimas que deben conservarse Consistencia resultado; distribución de trayectoria; secuencia de trayectoria; uso de recursos Versión del conjunto de tareas, cuenta de ejecuciones independientes, oráculo de resultados, secuencias de acción, unidades de recursos y cada registro por ejecución La robustez fallas; entorno; prontitud Los ensayos de base, los ensayos perturbados en pareja, una especificación de perturbación versionada y la prueba de que el entorno o el cambio inmediato preservaron el significado de la tarea Previsibilidad calibración; discriminación/AUROC; Brier Confidencia obtenida antes de la clasificación, evidencia de resultados binarios, método de clasificación o clasificación, recuento de muestras y fuente de confianza Seguridad cumplimiento; gravedad del daño Las restricciones de versión, cada violación, reglas de severidad, identidad y versión del juez, y una muestra de validación humana La primera regla operativa es, por lo tanto, simple: la métrica a sin su denominador, protocolo y ubicación de la evidencia no está disponible, no es baja y no es sana . Considere la consistencia del resultado. Re ejecutar cuarenta tareas cinco veces da 200 pruebas, pero una puntuación sola no le dice si las mismas tareas alternaron entre el éxito y el fracaso o si un subconjunto fijo falló cada vez. Estos patrones pueden tener una precisión media similar y consecuencias operativas muy diferentes. La métrica del papel existe para exponer esa distinción; descartar la evidencia a nivel de ensayo recrearía el problema que resuelve. Las métricas de robustez necesitan aún más cuidado. Un puntaje de inyección de fallas solo se puede interpretar en relación con una línea de base. Una puntuación de robustez rápida sólo es válida si las variantes siguen siendo semánticamente equivalentes. Renombrar un campo JSON puede probar la fragilidad ambiental; eliminar la información necesaria para resolver la tarea cambia la tarea. Guarde el generador de perturbaciones, su versión y una muestra revisada junto al resultado. La previsibilidad requiere una marca de tiempo igualmente estricta. Captura la confianza antes de que el calificador de resultados se ejecute. La confianza escrita después de que un agente haya visto un resultado de prueba no es un pronóstico. También registre si el valor proviene del agente, un modelo separado, un clasificador calibrado o una heurística. Calibración, AUROC, y Brier puntuaciones se pueden calcular correctamente a partir de la señal de confianza equivocada. Por último, preserve el límite de seguridad del papel. Su metodología pública informa de seguridad por separado del puntaje de fiabilidad agregado. Ese es el estándar correcto para las operaciones. Una puntuación fuerte de coherencia no debe averiguar una acción destructiva no autorizada. Las medidas de cumplimiento cuántas veces se respetaron las restricciones; la gravedad del daño condicional se pregunta cuán graves fueron las violaciones. Necesitas la frecuencia y la cola. Revisar el perfil antes de debatir los umbrales Los argumentos de umbral son prematuros cuando el paquete de pruebas es incompleto. Construí un pequeño linter de perfil que primero comprueba la estructura: existen las doce métricas nombradas; cada métrica tiene una puntuación, un numerador, un denominador, un protocolo y un URI de evidencia; los resultados de robustez incluyen recuentos de referencia y perturbaciones emparejados más una especificación versionada; los resultados de previsibilidad identifican la fuente de confianza; los resultados de seguridad identifican las limitaciones y el método de evaluación; la seguridad no se incluye en el agregado general de fiabilidad; un despliegue autónomo incluye una muestra de seguridad no vacía validada por humanos. A continuación, comprueba seis clases de pruebas de salud en vivo: frescura, accesibilidad, cobertura de horario, propiedad de espera, recibos de efecto de herramienta y recibos de resultado de destino. El perfil ilustrativo incluido contiene las doce métricas de papel y una revisión de la seguridad humana de 30 casos. Su resultado sigue siendo: Los dos bloqueadores carecen de recibos de efecto herramienta y resultado destino. El ensayo de encubrimiento suministra entonces esas dos referencias de evidencia y cambia el resultado a PASS . Eso no demuestra que el agente ficticio sea seguro; demuestra que el manifiesto de evidencia es lo suficientemente completo como para revisarlo. La distinción es importante. Realizar la auditoría con: Este es un artefacto deliberadamente modesto. Valida la presencia y la forma, no la validez científica. No puede decidir si un índice de referencia representa a sus usuarios, si un informe de confianza es honesto, si dos instrucciones significan lo mismo o si un juez de LLM calificó correctamente el daño. Estas siguen siendo tareas de revisión de dominios. No convierta el perfil en un solo número de liberación El documento calcula los agregados de dimensiones para apoyar la comparación, pero sus propias elecciones revelan por qué los operadores deben mantener el perfil visible. El agregado general de fiabilidad combina consistencia, previsibilidad y robustez; la seguridad permanece separada. El documento también establece límites importantes: dos puntos de referencia cubren solo una pequeña sección de tarea, se utiliza un andamio por punto de referencia, la evaluación de la seguridad depende de un juez LLM, las opciones métricas y de agregación son subjetivas y la temperatura cero puede sobreestimar la fiabilidad disponible en las configuraciones elegidas para maximizar la precisión. Dichos límites deben figurar junto a una decisión de despliegue y no en una nota de metodología archivada. Una revisión práctica puede utilizar tres capas: 1. Perfil completo: ¿Las doce métricas están respaldadas por pruebas inspectables? 2. Predes de aplicación: ¿Qué dimensiones y condiciones de cola son aceptables para esta tarea y para este nivel de autoridad? 3. ODebidas operacionales: ¿Es el sistema actualmente desplegado alcanzable, avanza, limita y produce el resultado externo previsto? La segunda capa es necesariamente específica de la aplicación. Un asistente de redacción de proyectos con revisión humana obligatoria puede tolerar diferentes inconsistencias de un agente de reembolso sin supervisión. El documento hace el mismo punto general: los requisitos de fiabilidad deben escalar con autonomía. Evite copiar una puntuación de la tabla de clasificación en un umbral de liberación universal. Para efectos secundarios consecuentes, utilice el veto antes de los promedios. Una política local razonable es: Este orden mantiene promedios atractivos de ocultar estados desconocidos o severos. Añadir la evidencia de producción que el documento no afirma medir Un índice de referencia evalúa el comportamiento bajo un protocolo definido. Un operador también debe saber lo que está sucediendo ahora. Añadir estos seis recibos sin pretender que son métricas extra de papel: E Fresqueza de la evidencia: cuando cada señal de salud fue revisada por última vez y cuando expira. Reaccionabilidad: si el tiempo de ejecución y las herramientas requeridas pueden ser contactadas ahora. Cobrecapacidad del horario: que las carreras esperadas se iniciaron, completaron, se superponían o se perdieron. Apropiedad de espera: si una dependencia legítima tiene un propietario, fecha límite y estado de reincorporación. Conciliación del efecto herramienta: si una acción temporizada o reprovada cambió su destino cero, una o varias veces. Verificación del resultado de destino: si el archivo prometido, cambio de base de datos, mensaje, resultado de prueba u otro producto entregado existe y cumple con su regla de aceptación. Este apéndice evita dos errores de categoría. En primer lugar, el éxito repetido de los valores de referencia no demuestra que se pueda alcanzar actualmente un tiempo de ejecución de la producción. En segundo lugar, una respuesta exitosa de comando o modelo no demuestra que exista el efecto externo o el entregable. El Repositorio de arneses HAL vinculado desde el sitio del proyecto es útil aquí porque hace hincapié en evaluaciones reproducibles, rastreos, aislamiento y seguimiento de costes. Esas son fuertes entradas de evaluación. Todavía necesitan un oráculo de resultados específico para el despliegue y recibos operativos actuales cuando el agente actúa fuera del índice de referencia. Usa el papel como un perfil, no un boleto de permiso. Para una revisión real, comience con un flujo de trabajo en lugar de una flota entera: 1. Pinifica el tiempo de ejecución, el modelo, el compromiso del andamio, las versiones de herramientas, la versión del conjunto de tareas y la fecha de evaluación. 2. Realice ensayos nominales repetidos y mantenga los resultados, las trayectorias y los registros de recursos. 3. Definir la falla, el entorno y las perturbaciones rápidas antes de inspeccionar el resultado. 4. Captura la confianza antes de la calificación. 5. Definir las restricciones y los niveles de gravedad; validar por humanos una muestra de seguridad. 6. Mantenga la seguridad separada del agregado. 7. Anexe las seis clases de pruebas de salud en vivo. 8. Registra unknown donde faltan pruebas. 9. Establecer umbrales y vetos para la autoridad y las consecuencias de este flujo de trabajo. 10. Vuelva a ejecutar el perfil después de cambios en el modelo de material, en el prompt, en el andamio, en la herramienta o en el entorno. Esto preserva la contribución principal del papel: la fiabilidad es una forma, no un sinónimo de precisión. También impide que esa forma se convierta en un tablero decorativo. El resultado observable de la revisión no es un puntaje de fiabilidad fue calculado. Es una decisión versionada con pruebas inspectables, desconocidos explícitos y una lista clara de lo que debe verificarse antes de que la autoridad se expanda. El territorio previsto de Sidewisp es el lado operativo de esa frontera: accesibilidad, progreso útil, contexto, herramientas, resultados y costo en torno a agentes que ya se ejecutan en otros lugares. Sidewisp se encuentra actualmente en versión preliminar privada. Sus adaptadores de monitoreo de producción y sistemas de recuperación no se envían generalmente, por lo que este artículo describe un método de operación, no una capacidad automática actual de Sidewisp. Si ese límite de pruebas coincide con los fallos que necesita detectar, puede unirse a la vista previa privada desde el sitio Sidewisp. Fuentes Rabanser et al., Hacia una ciencia de la fiabilidad de los agentes AI, arXiv v3, junio 2026 Metodología de fiabilidad del Leaderboard de agentes holísticos Arnés de evaluación reproducible HAL Página de cartel ICML 2026 Registro de OpenReview