2026-08-01T02:45:27.505Z

Agent Memory Benchmark: Auditar las lagunas detrás de un puntaje

Mapa AMB, MemoryArena y STATE-Bench a la evidencia que realmente producen, luego añadir reinicio, frescura, conflicto y controles de destino.

Un referente de memoria agent sólo es útil cuando su prueba coincide con el fallo que necesita detectar. La exactitud de la recuperación puede demostrar que el material almacenado es hallable. No puede, por sí solo, mostrar que la memoria sobrevivió a un reinicio, que la versión más reciente ganó un conflicto, o que un agente usó la memoria para producir el resultado externo previsto. Por lo tanto, el impago práctico no es elegir la puntuación más alta. Elegir el índice de referencia cuyo método ejerce su decisión más arriesgada, mantener sus preguntas descubiertas visibles y ejecutar un pequeño canario de producción junto a él. Audité tres enfoques actuales: AMB, MemoryArena y STATE Bench, en siete preguntas. Ninguno documenta todo el conjunto operativo. Tres puntos de referencia, tres unidades de prueba diferentes A.M.B. documenta una línea de cuatro etapas: ingerir documentos, recuperar el contexto, generar una respuesta, luego usar un segundo modelo para juzgar esa respuesta frente a las respuestas de oro. Traza el tiempo de recuperación e ingestión, así como la precisión, velocidad y costo de los tokens. Eso hace que AMB sea útil cuando la decisión se refiere a la calidad de recuperación y la economía entre los proveedores de memoria. Su método también explica por qué agentic en un nombre de conjunto de datos no es suficiente. El evento terminal documentado sigue siendo una respuesta generada y un resultado del juez. Esa es una evidencia significativa de resultados, pero no es lo mismo que observar a un agente cambiar correctamente un sistema de destino. MemoriaArena mueve la unidad de evidencia en un bucle de memoria agente ambiente. Sus 766 tareas hechas por el hombre tienen subtareas interdependientes a través de las sesiones. Las acciones posteriores dependen de la información y la retroalimentación adquiridas anteriormente, a través de la navegación web, la planificación limitada, la búsqueda progresiva y el razonamiento secuencial. El documento informa de un promedio de 57 pasos de acción por tarea. Este diseño aborda una debilidad real en la evaluación de solo recuerdo: un agente puede recuperar un hecho pero no aplicarlo cuando el entorno cambia. MemoryArena hace que la memoria sea consecuencia de la acción posterior. Sin embargo, una tarea de varias sesiones no es automáticamente una prueba de reinicio del proceso. A menos que el arnés destruya deliberadamente el componente de memoria y demuestre un estado duradero después del arranque, la persistencia sigue siendo una cuestión separada. En el caso de los Estados miembros prueba 450 tareas empresariales de estado a través de viajes, soporte al cliente y compras. Su pista de aprendizaje de agentes puede suministrar recuerdos reutilizables a través de un gancho de recuperación. Las métricas principales son el paso@1, el paso^5 en cinco carreras, una puntuación de experiencia del usuario evaluada por LLM y el costo por tarea. El límite de puntuación importa. Microsoft s Descripción de la liberación dice que las tareas de mutación de estado utilizan afirmaciones deterministas contra el estado final del entorno, mientras que las tareas procesales e informativas utilizan un juez LLM. Los resultados de las verificaciones de Estado Banco son exactos; todos los resultados de Estado Banco son deterministas no lo son. Mantenga los estados de cobertura en lugar de fabricar una puntuación Mapeé cada método documentado a siete preguntas. Covered significa que el método ejerce directamente la pregunta. Partial significa que proporciona pruebas pertinentes, pero no cumple con la afirmación operativa completa. Not documented significa exactamente eso; no es una acusación de que un proyecto no pueda realizar tal prueba. Pregunta sobre la evidencia A.M.B. MemoriaArena En el caso de los Estados miembros Calidad de recuperación Cubierta Partial Partial Guías de memoria para la acción posterior Partial Cubierta Cubierta Resultado final determinista Partial Partial Partial Persistencia de reinicio deliberado No documentado Partial No documentado Frescura y procedencia No documentado No documentado No documentado Confiabilidad de las operaciones repetidas No documentado No documentado Cubierta Costo o eficiencia Cubierta No documentado Cubierta Esta tabla no debe reducirse a dos de siete o cinco de siete. La cobertura no es aditiva. Si el incidente que teme es una política de reembolso obsoleta que sobrevive a una actualización, la exactitud de recuperación en un corpus estático y cinco carreras de tareas estables pueden ser verdes mientras el conflicto peligroso permanece intacto. El artefacto de auditoría valida la matriz y enumera todas las preguntas operativas descubiertas sin calcular una puntuación compuesta: Ejecutar esa regla contra la matriz de origen producida: Este resultado es falsificable. Un índice de referencia puede cambiar su método, añadir una fijación de reinicio explícita, requerir provenencia versionada o reemplazar a un juez con afirmaciones deterministas de destino. Actualice la matriz cuando cambie el método público. No conserve una vieja etiqueta no documentada como folclore. Elige por el fracaso, no por la tabla de clasificación Comience con la decisión concreta que tomará después de la carrera. Si está eligiendo un proveedor de recuperación, los datos de separación y cronometrado de ingesta/recuperación/generación/juzgado de AMB son directamente útiles. Ejecutar el mismo conjunto de datos, dominio, modelo de generación, juez de instrucción y modo para cada proveedor. Su README advierte de que pequeños cambios en el prompt o modelo pueden mover la precisión en dos dígitos, por lo que una comparación sin esos pines de versión no es reproducible. Si su riesgo es que la información recordada esté disponible pero no cambie el comportamiento posterior, utilice una prueba acoplada a la acción. Las subtareas interdependientes de MemoryArena hacen que la información anterior sea necesaria causalmente en sesiones posteriores. Preservar el manifiesto de tareas y la versión del entorno, y luego inspeccionar la primera acción que diverge, no sólo el puntaje final de la tarea. Si la decisión es si la memoria mejora un flujo de trabajo de estado de manera consistente, STATE Bench ofrece una opción por defecto más fuerte. Compare la línea de base sin memoria con el mismo agente más memoria; mantenga el paso@1, el paso^5, el costo y el tipo de puntuación separados. Una ganancia en la media de finalización junto con una caída en el pase^5 no es una promoción limpia. Tampoco es equivalente a una afirmación de base de datos determinista una aprobación de procedimiento juzgada por LLM. Estas opciones pueden combinarse. Un pequeño equipo puede ejecutar AMB para eliminar una implementación de recuperación que es demasiado inexacta o costosa, luego ejecutar una suite de acción enfocada, luego usar un subconjunto STATE Bench para resultados de flujo de trabajo repetidos. La secuencia es defendible porque cada etapa responde a una pregunta nombrada. Un número combinado del ranking ocultaría por qué un candidato pasó. La limitación es importante: esta auditoría compara métodos documentados; no repite todos los puntos de referencia ni afirma que no existen pruebas privadas indocumentadas. Las tareas sintéticas, los usuarios simulados, los modelos de evaluador, la cobertura de dominio y las revisiones de repositorios limitan la medida en que un resultado se transfiere a su carga de trabajo. Añadir los controles operativos de referencia dejar abierto La evidencia fuera de línea debería terminar en un límite de promoción. Un canario vivo compacto debería comenzar ahí. Utilice identificadores libres de contenido cuando la memoria real pueda contener material privado. Por ejemplo, escriba una identificación aleatoria de canario, una versión, un hash de una decisión esperada y un tiempo de vencimiento. Mantenga los datos en bruto, conversación, secreto y de los clientes fuera del evento de salud. Entonces ejecuta esta cadena: 1. AReconocer la escritura. Registrar el espacio de nombres de memoria, ID canario, versión esperada, versión de adaptador y recibo de escritura. Una respuesta HTTP exitosa no es la prueba de que el índice o almacén duradero requerido haya aceptado el registro. 2. Crossa un límite de reinicio real. Reinicia el servicio de memoria, el tiempo de ejecución del agente o el adaptador de host en el que realmente depende. Empezar un nuevo chat dentro del mismo proceso prueba un límite diferente. 3. Leer con frescura y procedencia. Requerir la versión esperada y una referencia de fuente inspectable. Un valor antiguo semánticamente plausible es un fracaso, no una pérdida cercana. 4. Inject a conflict. Escribir un valor más nuevo, conservar el antiguo identificador, y verificar que el resolver devuelve el ganador previsto. Registrar si la política es de última redacción, versión explícita, prioridad de la fuente o aprobación humana. 5. Requiere una acción consecuente. Dar a la agente una tarea donde el argumento de herramienta correcto depende del canario. Verifique el argumento o la transición de estado, no la explicación que produce el modelo. 6. Verifique el destino. Lea el sistema externo o artefacto que representa la finalización. La salida del comando, el éxito de la llamada de herramientas y el éxito reportado por el agente son evidencia de actividad. 7. Repetir dentro de los límites. Ejecutar suficientes casos equivalentes para revelar inconsistencia, mientras fija el modelo, el prompt, la herramienta y las versiones del entorno. El coste de seguimiento junto al resultado verificado. Un recibo mínimo puede verse así: No marque el recorrido de memoria sano si no está disponible un campo requerido. Regresa uncertain , preserva el último tiempo de evidencia conocido, y envía la señal que falta a una persona. La respuesta segura a pruebas incompletas no es un nuevo intento automático que pueda repetir un efecto externo. Una regla de promoción que puedes explicar Promover un cambio de memoria sólo cuando tres declaraciones son todas ciertas: el indicador de referencia elegido ejerce directamente el comportamiento que motivó el cambio; los resultados repetidos mejoran o mantienen la calidad sin violar el límite de costes acordado; el canario vivo demuestra la persistencia de reinicio, la versión/proveniencia correcta, el uso consecuente y el resultado esperado de destino. Si alguna afirmación no está respaldada, mantenga el cambio en la evaluación. Esta regla es deliberadamente más estricta de lo que fue el índice de referencia, pero más estrecha que la creación de una plataforma de evaluación universal. Da a un pequeño equipo una razón auditable para continuar o detenerse. La dirección del producto de Sidewisp trata las lecturas o escrituras de memoria faltantes, la persistencia fallida a través de los reinicios, la sincronización obsoleta, los reajustes, el crecimiento del contexto y las decisiones perdidas como señales de salud. El motor de monitoreo de producción y los adaptadores de tiempo de ejecución no se envían en el repositorio actual del sitio web. Sidewisp se encuentra actualmente en versión preliminar privada. Si ese modelo de evidencia coincide con la forma en que opera a los agentes, puede unirse a la lista de espera de vista previa privada sin reemplazar su tiempo de ejecución o tratar un punto de referencia fuera de línea como un certificado de salud en vivo.