2026-08-01T15:00:25.546Z
Marco de pruebas de agentes AI: elegir por evidencia, no contar características
Un selector ejecutable de cuatro puertas compara repetición, efecto herramienta, memoria y evidencia de resultados y luego expone los adaptadores cada recomendación que aún necesita.
Un marco de pruebas de agentes AIZ debe elegirse por la evidencia que pueda reproducir y verificar, no por el número de métricas en su catálogo. Para un agente de estado, que utiliza herramientas, el primer prototipo razonable es Inspeccionar AI cuando los entornos desechables, la ejecución de agentes externos y los marcadores de código son centrales. LangWatch Scenario es el prototipo de mejor forma cuando los usuarios simulados y el comportamiento de múltiples vueltas dominan. MLflow se ajusta a los equipos cuyos conjuntos de datos de evaluación y historial de experimentos ya son la capa organizadora; DeepEval se ajusta a un flujo de trabajo de regresión centrado en pytest. Ese es un prototip de orden, no una tabla de clasificación universal. Ninguno de estos marcos sabe si su factura fue creada una vez, su memoria sobrevivió a un reinicio, o su entregable prometido es válido. Esos son oráculos de aplicación. Un proceso de selección es honesto sólo cuando nombra el trabajo restante antes de la adopción. Comienza con las pruebas que el marco debe dejar atrás Las pruebas de agente no son pruebas rápidas ampliadas. Un agente cambia de estado en varios giros, cruza los límites de permisos, llama a las herramientas, espera, vuelve a intentarlo y puede terminar con un artefacto externo. Una respuesta final fluida es una observación entre varias. Guía de evaluación de agentes de Anthropic separa la tarea, los ensayos, la transcripción, el resultado, el arnés de evaluación y los calificadores. También distingue la clasificación basada en código, basada en modelos y humana. Esa descomposición nos da una útil pregunta de selección: ¿De dónde vendrá cada hecho decisivo? Utilice cuatro puertas: Puerta de entrada Se requieren pruebas Substituto falso común Reproduce El mismo dispositivo puede restaurar las entradas relevantes, el estado de la herramienta, los permisos y los datos de inicio Reenviando el mismo aviso Efecto de herramienta El destino demuestra que el efecto previsto ocurrió con la identidad y el recuento adecuados Un rastro dice que la herramienta fue llamada Continuidad de memoria Las decisiones requeridas sobreviven al límite que realmente temes: reiniciar, compactar o entregar La conversación tiene varios giros Verificación de resultados Una verificación determinista demuestra que el artefacto o estado prometido existe y es válido El agente dice que terminó. Un marco puede exponer los ganchos para los cuatro sin implementar sus cuatro pruebas. Eso es aceptable. El mal resultado es ocultar una consulta de base de datos personalizada, reinicio fijo o validador de artefactos bajo la vaga etiqueta integración. La distinción es más importante en dos límites. Una llamada de herramienta puede terminar después de que el destino haya cometido su cambio, por lo que el éxito del transporte y el éxito del efecto pueden estar en desacuerdo. Una prueba de múltiples vueltas puede preservar el estado en un proceso mientras que el agente desplegado pierde la misma decisión después de un reinicio. Si una comparación de marcos se derrumba en cualquiera de los pares, su puntaje no es útil para la fiabilidad del agente. Cuatro marcos actuales, leídos a través de esas puertas Revisé la documentación oficial actual el 27 de julio de 2026 y registré sólo superficies documentadas. Un nivel de custom por debajo no es una crítica; significa que el marco proporciona un punto de extensión mientras que la aplicación debe proporcionar la verdad. Iinspect AI documenta conjuntos de datos compuestos, agentes, herramientas y marcadores, ejecución de agentes externos, registros de evaluación y varios fondos de caja de arena. Su Presentación general oficial incluso utiliza un agente que actúa a través de herramientas dentro de una caja de arena Docker. Eso lo convierte en una fuerte superficie de partida para tareas ejecutables y complejas. Un marcador personalizado puede inspeccionar el entorno resultante. Todavía necesita un conector al destino real y un oráculo de reinicio de memoria construido deliberadamente. LangWatch Scenario comienza con una simulación de múltiples vueltas en lugar de una fila de entrada y salida estática. Su documentación de simulación de agentes muestra expectativas intermedias de llamadas a herramientas, afirmaciones personalizadas como un boleto creado, pruebas de recuperación de errores y reproducción de problemas encontrados en la producción. Esa forma es atractiva para el apoyo, la voz y otros agentes interactivos. El estado documentado de conversación no es prueba de que una decisión sobrevivió a la muerte del proceso, y una declaración de billete sigue siendo código de solicitud. MLflow organiza la evaluación en torno a conjuntos de datos, funciones de predicción, marcadores, resultados de ejecución, retroalimentación humana y monitoreo. El Presentación general de la evaluación actual de GenAI hace que la puntuación personalizada sea una parte de primera clase de una carrera de evaluación. Esto es útil cuando el equipo ya trata conjuntos de datos y el linaje experimental como su fuente de verdad. El costo de selección es el arnés de estado en torno a la función de predicción: restaurar un mundo de herramientas, forzar un reinicio y reconciliar los efectos externos. DeepEval ofrece pruebas locales, casos de giro único y múltiple, umbrales, seguimiento y comparación de regresión en un flujo de trabajo en forma de pytest. Su el arranque rápido es una fácil salida para los equipos que quieren evaluaciones además de las pruebas de aplicación. El arranque rápido se apoya en métricas basadas en modelos, por lo que una prueba operativa de ajuste debe agregar controles deterministas de efecto y resultado en lugar de suponer que una puntuación del juez prueba el estado de destino. Cuadro de trabajo Centro de gravedad documentado El prototipo primero cuando Adaptadores explícitos para la prueba Inspección de AI tareas ejecutables de los agentes, herramientas, cajas de arena, marcadores El agente cambia archivos u otro estado inspectable Efecto de destino real; reinicio de la memoria Escenario de LangWatch Simulación y afirmaciones de pasos en múltiples vueltas El comportamiento del usuario y las vías de recuperación conducen a fallas Efecto de destino real; reinicio de la memoria Flujo ML Datasets, marcadores, historial de ejecución, retroalimentación El ciclo de vida de la evaluación y el linaje ya viven en MLflow Fijación de estado; efecto; reinicio de memoria Profundidad Regresión y rastreo métrico de estilo pitest El equipo necesita un punto de entrada ligero en la suite de pruebas. Fijación de estado; efecto; reinicio de la memoria; resultado determinista Esta tabla es deliberadamente más estrecha que una comparación de productos. No dice nada sobre el precio del alojamiento, el soporte, la capacidad de respuesta del mantenedor o cualquier integración. Responde a una pregunta: ¿cuál superficie documentada de ejecución está más cerca de la evidencia necesaria para este agente? Ejecutar el selector, luego desconfiar de la puntuación El framework evidence.json que lo acompaña registra cuatro niveles de evidencia para cada candidato. 0 significa que no se conservan pruebas de la fuente primaria, 1 significa que se requiere un adaptador o marcador personalizado explícito y 2 significa que la documentación presenta un flujo de trabajo de primera clase. El escenario de herramientas de estado pondera la repetición en 2 , los efectos de herramientas en 4 , la continuidad de memoria en 4 y los resultados verificados en 5 . Ejecutar el artefacto: La parte decisiva de la producción es: Inspect y LangWatch Scenario reciben una puntuación ponderada de evidencia de 22 . Inspect gana esta fijación solo porque la carga de trabajo declarada es stateful tool , lo que añade un bono de ajuste de tres puntos. Cambiar la carga de trabajo a simulación de múltiples vueltas y el orden debe cambiar. Cambiar los pesos y el resultado puede cambiar. Esa sensibilidad es una característica: hace que las suposiciones del equipo sean revisables. La puntuación nunca debe borrar las lagunas. Un resultado que afirme que el trabajo del adaptador aquí sería menos creíble, no más. La matriz no puede conocer el esquema del destino, la regla de identidad de un efecto, las decisiones que la memoria debe retener, o la regla de validez para el entregable. El artefacto también tiene una dura limitación: es una auditoría de documentación fechada. No instala los cuatro marcos ni mide el tiempo de integración. Usala para elegir el orden de los experimentos, luego deja que dos casos incómodos decidan. Hacer que la prueba de ajuste falle de dos maneras diferentes El primer caso prueba un efecto de herramienta ambiguo. Arreglar una fijación de destino en la que la herramienta comprometa un objeto y el transporte devuelve un tiempo de espera. El arnés sólo pasará si puede: 1. mantener una identidad de operación estable a través de los límites de retiro; 2. inspeccionar el destino en lugar de confiar en el resultado de la llamada; 3. clasificar al Estado como comprometido, no volver a intentarlo ciegamente; 4. mostrar la evidencia en un registro de ejecución que un desarrollador puede deshacer. En el segundo caso de pruebas se reinicia la continuidad. Deja que el agente elija un plan limitado, persista sólo en el estado de decisión permitido, termina su proceso y reanuda con un nuevo proceso. El arnés sólo pasará si puede: 1. demostrar que se ha producido el reinicio; 2. restaurar el mismo dispositivo sin filtración del estado de respuesta oculta; 3. verificar la supervivencia de la decisión requerida; 4. detectar memoria obsoleta, ausente o contradictoria; 5. verificar el artefacto final de forma independiente. Incluir una espera legítima como control si el agente solicita su aprobación. Un arnés de prueba que marque cada pausa como falla presionará al producto para que elimine los límites de autoridad seguros. La evidencia debe distinguir el trabajo, la espera, el atado y el completo en lugar de recompensar la actividad ininterrumpida. En la caja de tiempo el prototipo. Un pequeño equipo no debe construir una capa de adaptador general antes de haber reproducido estas dos fallas. Dale a cada candidato el mismo dispositivo, el mismo oráculo de resultados, y el mismo presupuesto de depuración. Prefiere el marco que haga que la cadena de pruebas sea más corta y más inspeccionable, incluso si otro candidato produce métricas más agregadas. El resultado no es framework X es el mejor. Es framework X alcanza nuestras dos pruebas duras con estos adaptadores llamados, y framework Y no dentro del mismo presupuesto. Esa declaración puede sobrevivir a una revisión de código. Las pruebas de prueba no son agentes vivos de salud La evaluación previa a la liberación responde si una construcción puede manejar tareas conocidas y fallos controlados. La salud en vivo se pregunta si un agente en particular desplegado es accesible ahora, haciendo progresos útiles, manteniendo el contexto requerido, alcanzando sus herramientas, produciendo el resultado esperado y manteniéndose dentro de límites de tiempo y costo razonables. Pasar una evaluación no demuestra un programador despedido anoche, una credencial es válida hoy, o un producto entregado llegó a su destino real. El territorio previsto de Sidewisp es esa capa de salud en torno a los tiempos de ejecución existentes: distinguir el trabajo de esperar o quedar atrapado, mostrar evidencia y frescura, y verificar los resultados antes de resolver un problema. Sidewisp se encuentra actualmente en versión preliminar privada. La experiencia pública es un sitio web de acceso temprano y una demostración interactiva; generalmente no se envían recopilación de agentes de producción y salud, adaptadores de tiempo de ejecución y recuperación automática. Así que mantén el límite explícito. Utilice el marco de ensayo elegido para hacer visibles las regresiones controladas antes de su liberación. Utilice pruebas específicas del tiempo de ejecución y controles de resultados independientes para establecer la salud en vivo después de su liberación. Una prueba verde es una prueba valiosa, pero no es el permiso para tratar un agente no observado como saludable.