2026-08-01T14:17:53.545Z

Metricas de evaluación de los agentes AI: cinco señales, sin puntaje compuesto

Utilice cinco denominadores explícitos y puertas de pruebas duras para comparar las liberaciones de agentes sin ocultar el falso éxito, efectos de herramientas desconocidos o fallos costosos.

Las métricas de evaluación del agente AI deben responder a una pregunta de liberación, no decorar un panel. Para un agente que utiliza herramientas, un defecto compacto es cinco medidas mantenidas separadas: calidad de la tarea, progreso útil, integridad del efecto de la herramienta, costo por resultado verificado y tasa de fracaso falso. Registra la cobertura de la evidencia junto a cada uno. Luego haga que los resultados perdidos y los efectos de herramientas desconocidos sean puertas duras antes de optimizar los promedios. Que el ordenes importa. Un candidato puede escribir mejor prosa, terminar más rápido, y parecer más barato por carrera mientras produce un resultado no verificado. Mediar esas señales en una puntuación convierte una liberación insegura en una mejora numérica. Mantenga cinco denominadores en lugar de una puntuación La evaluación de agentes tiene más de un objeto de interés. Guía de ingeniería de Anthropic para evaluaciones de agentes distingue las tareas, los ensayos repetidos, los calificadores, las transcripciones y el estado final del medio ambiente. Su ejemplo de reserva de vuelo es el límite útil: la transcripción puede decir que un vuelo fue reservado, mientras que el resultado es si la reserva existe en la base de datos. El Descripción de la evaluación de los agentes de Vertex AI actual hace otra separación. La evaluación de la respuesta final pregunta si el agente ha alcanzado la meta; las métricas de trayectoria inspeccionan el camino, incluidas las coincidencias exactas o ordenadas de acción, la precisión, la recuperación y el uso de una sola herramienta. Ambos puntos de vista son útiles, pero ninguno debe sustituir silenciosamente al otro. Utilice este contrato de cinco métricas: Metría Numerador Denominador Se conservan por separado Función de liberación Calidad de las tareas Suma de las puntuaciones de calidad de las rúbricas o deterministas versionadas Pruebas para las cuales el calificador de calidad realmente corrió Versión de calificación, cobertura, desacuerdo Optimiza después de que las pruebas duras pasen Un progreso útil Ventanas de observación activas con un delta de pruebas específico de la tarea Las ventanas activas observadas Ventanas de espera explícitas y coleccionistas obsoletos piso, luego optimizar Integridad del efecto herramienta Efectos externos verificados en el destino Intentos verificados + fallidos + de efectos desconocidos Las llamadas rechazadas intencionalmente, efectos desconocidos suelo duro Costo por resultado verificado Costo total de ejecución cubierto Resultados verificados por destino Costo estimado, falta de cobertura de facturación Planas presupuestarias y optimización Taxa de fracaso falso Completos declarados cuya comprobación de resultados falló Todas las finalizaciones declaradas Completos cuyo verificador no estaba disponible El veto es duro. Cada denominador evita una mentira diferente. La calidad media sin cobertura de calificaciones recompensa a los ejemplos más fáciles. El éxito de la herramienta sin pruebas de destino confunde una llamada exitosa con un efecto exitoso. El costo por carrera recompensa los fracasos baratos. La tasa de finalización recompensa a un agente por calificar su propia reclamación. La telemetría operativa todavía pertenece al libro mayor. El OpenTelemetry instantánea de las métricas de GenAI fijado define los instrumentos de estado de desarrollo para el uso de tokens, la duración de la operación, la duración del agente, el recuento de inferencias, el recuento de llamadas de herramientas y la duración de las herramientas. Estas mediciones explican la carga de trabajo y la eficiencia. No afirman que exista un expediente, que una factura haya sido creada una vez o que un informe programado haya llegado a su destino. Escriba el registro de pruebas antes de elegir los umbrales Comienza con una fila por ensayo. No comience con un gráfico agregado. Un registro mínimo necesita suficiente información para reproducir cada numerador, denominador, exclusión y estado no disponible: El valor importante no es 0.90 ; es el desacuerdo que lo rodea. El calificador de respuesta le gustó la salida, pero el verificador de resultados no estaba disponible y el efecto de la herramienta permaneció desconocido. Este ensayo puede enseñarte sobre la calidad de la respuesta. No puede apoyar una solicitud de liberación. Utilice tres estados de evidencia siempre que sea posible la ausencia: verified significa que el predicado denominado se dirigió contra el destino previsto y pasó. failed significa que el predicado se ejecutó y el estado esperado estaba ausente o inaceptable. unavailable significa que ningún veredicto fue posible porque el verificador, el recaudador, el permiso o la evidencia de destino faltaba. No convierta unavailable en cero o con éxito. Cero es una medida; no disponible es un defecto de cobertura. La espera requiere un cuidado similar. Una carrera con un propietario de aprobación explícita, la decisión solicitada, la fecha límite y el estado de reanudabilidad no está atascada. Contar el progreso útil durante las ventanas activas antes de la espera, y luego detener el reloj de progreso activo. Mantenga la llamada de herramienta de alto impacto negada como prueba de que el límite funcionó; no considere una negación intencional como falla de la herramienta. La calidad de la tarea es la única métrica que probablemente necesite varios tipos de calificadores. Utilice pruebas deterministas para campos estructurados, archivos, filas de base de datos, estado HTTP y condiciones exactas de política. Un calificador de modelo puede calificar el tono, la relevancia o un artefacto sin límite, pero almacena su respuesta, modelo, versión de rúbrica y muestra de calibración. La revisión humana sigue siendo necesaria cuando el juicio es consecuente o no se entiende la tasa de desacuerdo del modelo de calificación. Reproducir la inversión de liberación El artefacto conservado con este artículo contiene diez ensayos sintéticos: cinco para stable v1 y cinco para fast v2 . Ejecutarlo con Node.js 20 o más reciente: Los umbrales declarados son: El resumen exacto es: Variante Calidad Un progreso útil Efectos de las herramientas verificados Costo / ejecución Costo / resultado verificado Falso éxito Completo no verificado Puerta de entrada : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 Pasado fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 El fracaso Tres observaciones cambian la decisión. Primero, fast v2 parece más barato cuando el denominador se ejecuta: $0.38 en lugar de $0.41. Una vez que el gasto se divide por resultados verificados, la conclusión se invierte: 0,63 dólares en lugar de 0,52 dólares. La versión más rápida gastó menos en cada intento y más en cada resultado en el que podías confiar. En segundo lugar, la puntuación de calidad más alta de 0,902 no repara un resultado perdido. Una finalización pulida falló en su comprobación ambiental; otra no tenía un verificador utilizable. Los promedios de calidad y de progreso útil siguen siendo diagnósticos, pero no son autoridad para publicar, pagar, enviar mensajes, eliminar o aceptar de otra manera un efecto externo. En tercer lugar, stable v1 contiene una espera legítima de aprobación. No está presente en el denominador de calidad del ensayo completado, pero los progresos realizados antes de la espera y la llamada de herramienta rechazada intencionalmente siguen siendo visibles. El contrato métrico no recompensa el teatro de finalización ni castiga una pausa correcta. Este experimento es un contraejemplo, no un punto de referencia. Los precios, los ensayos y los umbrales se construyen para probar la regla contable. No estiman una tasa de falso éxito de producción, y $0.60 no es un presupuesto universal. Prueba de puertas antes de optimizar la calidad Aplicar las métricas en orden fijo: 1. Check coverage. Cada finalización declarada necesita un veredicto de resultado o un estado explícito no disponible. Cada intento de herramienta con efecto necesita pruebas verificadas, fallidas o desconocidas de destino. 2. Block falso éxito. Si una finalización declarada no logró su comprobación de resultados, detenga la liberación. Investigue el predicado de finalización, no el estilo de respuesta. 3. Block efectos desconocidos. Un efecto secundario desconocido es un límite de incidencia. Pregunte el destino o reconciliar una clave de idempotencia antes de volver a intentarlo. 4. Check progress and tool floors. Comparar tareas similares y mantener las expectativas válidas. Una regresión del progreso o una tasa de efecto herramienta fallida pueden justificar un retroceso incluso cuando la calidad final aumenta. 5. OOptimiza la calidad y el costo. Sólo ahora compara las puntuaciones de rubrica, latencia, tokens y costo por resultado verificado. Este no es un compuesto ponderado deliberadamente. Los pesos invitan a negociar entre los daños no relacionados: una fluidez suficiente puede cancelar matemáticamente un pago duplicado; un número suficiente de carreras baratas puede ocultar un informe faltante. Una política todavía puede utilizar pesas dentro de la rúbrica de calidad de tarea, pero la cobertura de la evidencia y los efectos externos permanecen fuera de ese puntaje. Seleccione los umbrales de las consecuencias del flujo de trabajo y de la línea de base. Un agente de investigación de sólo lectura puede tolerar un piso de efecto de herramienta más bajo porque la mayoría de las llamadas son reversibles. Una publicación, facturación, mensajes al cliente o agente de control de acceso deben requerir recibos de destino, idempotencia y un objetivo de éxito falso cero para el conjunto de pruebas cubierto. Informar los intervalos de confianza cuando el número de ensayos sea lo suficientemente grande, y mostrar el número bruto cuando no lo sea. Cinco ensayos son 0/5 , no prueba de una tasa de fracaso de la población cero. Mantenga la evaluación y la salud de la producción conectadas pero distintas. Los ensayos fuera de línea te dicen si un candidato sobrevive a escenarios conocidos. El monitoreo de la producción le dice si los horarios reales, credenciales, dependencias, costos y resultados permanecen saludables después de su liberación. Una suite de paso es un permiso para desplegar en el alcance declarado, no una prueba de que futuras carreras no pueden fallar. La dirección del producto de Sidewisp es poner los resultados, el progreso, la herramienta, la disponibilidad, la memoria y la evidencia de costos en una visión de salud alrededor de los tiempos de ejecución de los agentes existentes. No es un tiempo de ejecución de reemplazo, puerta de entrada obligatoria o fijación autónoma. Sidewisp se encuentra actualmente en versión preliminar privada. El sitio público y la biblioteca de artículos están en vivo; la colección de agentes de producción y salud, los adaptadores de tiempo de ejecución, el análisis de costos de tokens y la ejecución de recuperación no se envían generalmente. Utilice el contrato de cinco métricas en un flujo de trabajo consecuente primero. Si la versión con el promedio de mejor aspecto todavía falla en un resultado o puerta de efecto de herramienta, las métricas han hecho su trabajo.