2026-08-01T01:58:02.122Z

LLM Observabilidad: Auditoría del contrato de línea de tiempo del agente

Prueba el agrupamiento de conversaciones, la atribución de agentes, la correlación de herramientas y la propagación de errores antes de confiar en la línea de tiempo del agente Honeycomb.

Honeycomb puede mostrar una línea de tiempo de agente pulida y aún estar trabajando desde un contrato de evento roto. Antes de usar esa vista para diagnosticar un incidente de múltiples agentes, verifique seis cosas en los intervalos emitidos: una identidad de conversación, nombres de agentes distintos, atribución de invocación del lado de la llamada, nombres de operación reconocidos, IDs estables de herramientas de llamada y errores propagados. La prueba práctica no es ¿Ha llegado la telemetría?¿Es ¿Pueden estos campos proyectar el trabajo en la conversación correcta, el carril del agente, la operación y el estado de falla? La auditoría siguiente responde a esa pregunta más estrecha con ocho accesorios libres de contenido. Si el Znot recoge instrucciones o afirma que una línea de tiempo limpia prueba el resultado externo solicitado. Lo que el agente Honeycomb Timeline proyecta realmente Honeycomb documenta a Agente Timeline como una vista de conversaciones enteras que pueden abarcar múltiples huellas. La llave de conversación es gen ai.conversation.id . Dentro de una conversación, los espacios de GenAI se agrupan por gen ai.agent.name , luego se presentan como invocaciones de agentes, operaciones LLM y llamadas de herramientas de acuerdo con gen ai.operation.name . Esto hace que la vista sea útil, pero también hace que varios campos proporcionados por la aplicación formen parte del límite de diagnóstico: gen ai.conversation.id decide cuáles espacios pertenecen juntos. gen ai.agent.name decide qué agente es dueño de un carril. gen ai.operation.name decide si un span se trata como chat, invocación de agente o ejecución de herramienta. gen ai.tool.call.id permite a un operador correlacionar una solicitud de herramienta con su resultado. los campos de estado de error y excepción determinan si una falla es visible en el intervalo afectado y su origen. La guía de instrumentación de Honeycomb marca la identificación de conversación, el nombre del agente y el nombre de operación según sea necesario para su vista del agente. También dice que un nombre de agente desaparecido aparece como Unknown , y que los nombres duplicados impiden a los operadores distinguir a los agentes durante una investigación. La misma guía hace explícita una regla de atribución fácil de perder: el agente calling emite el intervalo invoke agent . El agente llamado emite su propio chat , execute tool , y otros espacios bajo su propio nombre único. Si una transformación de colector asigna la invocación a la llamada, la línea de tiempo puede contener cada período que cuenta la historia causal equivocada. Este es un problema de conformidad de esquema antes de que sea un problema de tablero. Hacer preguntas más duras no puede recuperar una identidad que nunca fue emitida o corregir un nombre de agente que dos trabajadores comparten. Auditar el contrato de proyección antes de un incidente El accesorio de acompañamiento contiene ocho pequeños conjuntos de espacios. Ninguna contiene instrucciones, respuestas, argumentos de herramientas, identificadores de clientes o secretos. Los únicos valores son IDs de conversación sintéticas, instancias de agentes, nombres de agentes, nombres de operaciones, enlaces parentales, IDs de llamada de herramienta y campos de estado. Ejecutar la auditoría desde el directorio de artefactos de artículos: El clasificador aplicará los controles en orden causal: 1. Todos los espacios de la conversación propuesta deben compartir una identificación de conversación no vacía. 2. Cada espacio debe tener un nombre de agente no vacío. 3. Un nombre de agente mostrado no debe pertenecer a múltiples instancias de agentes. 4. El solicitante deberá poseer un invoke agent . 5. La operación deberá pertenecer al conjunto de operaciones de GenAI documentado utilizado por la proyección. 6. Un espacio de tiempo execute tool debe conservar un identificador de llamada de herramienta. 7. Un error infantil no debe quedar por debajo de un padre que aún reporta éxito. El orden importa. Si una conversación ya está dividida entre conv 201 y conv 202 , contar carriles de agentes dentro de cualquiera de los fragmentos da una respuesta precisa a la pregunta equivocada. Del mismo modo, si ambos procesos se llaman worker , la correlación entre la herramienta y la llamada no puede restaurar la identidad del agente que falta. Las reglas son intencionalmente más estrictas que Honeycomb renderizado algo. Una vista renderizada es una observación. Un envase de extensión conforme es evidencia de que la observación fue agrupada y atribuida de acuerdo con un contrato declarado. Ocho aparatos exponen siete verdes falsos diferentes La ingenuidad de la regla de comparación sólo verifica que cada período tiene una identificación de conversación. Accepta las ocho configuraciones, incluido el caso en el que dos ID no vacíos diferentes dividan una conversación lógica. La auditoría de conformidad acepta exactamente una: Las instalaciones Verificación de identidad ingenuo Veredicto de conformidad Requisitos de reparación conversación válida el paso CONFORMANT No hay nada conversación fragmentada el paso FRAGMENTED CONVERSATION Propagar una identificación de conversación a través de los límites de rastreo agente desconocido el paso UNKNOWN AGENT emitir un nombre estable y no vacío del agente agente nombre colisión el paso AGENT NAME COLLISION dar a cada instancia de agente un nombre operativo distinto Cumplimiento de las obligaciones el paso INVOKE ATTRIBUTION INVALID emitir invoke agent desde el solicitante operación no reconocida el paso OPERATION UNRECOGNIZED remap a una operación documentada de GenAI Identificación de llamada de herramienta faltante el paso TOOL CALL UNCORRELATED preservar la identificación de llamada a través de la solicitud y el resultado error infantil oculto el paso ERROR PROPAGATION BROKEN propagar el estado de fallo al padre Cada veredicto protege una decisión diferente del operador. Una conversación fragmentada oculta el trabajo. Un nombre desconocido o en conflicto corrompe la propiedad. La atribución de invocación errónea invierte quién delegó a quién. Una operación no reconocida deja un evento en la categoría visual equivocada. Una identificación de llamada faltante hace que un tiempo fuera peligroso para reconciliar. Un error oculto de un niño convierte un camino de herramientas fallido en un padre parecido exitoso. El último caso merece una atención especial. Honeycomb aconseja registrar errores de manera consistente y propagar un fallo en la llamada de herramienta a la franja matriz. Esta propagación no demuestra si se ha producido un efecto secundario externo, sino que impide que el padre permanezca silenciosamente verde mientras se sabe que el niño ha fallado. Para las herramientas eficaces, añadir un recibo de destino separado después de esta verificación de telemetría. Un tiempo más ninguna respuesta es un efecto incierto, no permiso para volver a intentarlo. La línea de tiempo del agente puede ayudar a localizar la llamada ambigua; el destino autorizado debe decidir si el efecto existe. Convertir la auditoría en un canario de despliegue Aplique el dispositivo localmente primero, y luego adapte una conversación canaria inofensiva a su camino de instrumentación. Mantenga el canario libre de contenido y haga su topología obvia: un agente del enrutador invoca a un trabajador; el trabajador realizará una llamada de herramienta inofensiva; cada espacio recibe la misma identificación de conversación sintética; el router y el trabajador tienen nombres distintos; la invocación pertenece al router; la llamada a la herramienta conservará una identificación de llamada sintética; una variante de ensayo falla deliberadamente la herramienta y comprueba que la madre ya no tiene éxito. Comparar el sobre emitido antes de la exportación y después de cualquier transformación del colector OpenTelemetry. Esto atrapa un fallo de límite común: la instrumentación de la fuente es correcta, pero una transformación de renombros se extiende, deja un atributo o asigna un nombre de agente estático a cada proceso. Pinta esa transformación. Las convenciones semánticas del agente de OpenTelemetry GenAI inspeccionadas para este artículo están marcadas Development , por lo que una actualización de SDK o Collector no es un cambio visual rutinario. Es un cambio de esquema que debería volver a ejecutar el canario. Utilice un pequeño registro de aceptación para cada lanzamiento: No incluya instrucciones, respuestas, argumentos de herramientas o resultados de herramientas en este registro. Honeycomb señala que el contenido del mensaje puede contener PII y recomienda colocar dicho contenido en eventos de duración donde un Colector puede filtrarlo. El canario de conformidad necesita identidades y estatus, no contenido de conversación. Donde esta prueba se detiene La aprobación de la auditoría significa que el envase de duración suministrado puede proyectarse de manera coherente en la línea de tiempo del agente Honeycomb. No establece que: cada esparcimiento alcanzó Honeycomb; el muestreo conservó el fallo crítico; un agente está haciendo progresos útiles; una espera humana legítima tiene un propietario y una fecha límite; un efecto secundario de la herramienta cometido exactamente una vez; el archivo, boleto, despliegue o informe prometido existe; la respuesta es factualmente o semánticamente correcta. Esas son preguntas de salud separadas. Trata el cumplimiento de la línea de tiempo como la entrada para el diagnóstico, no el veredicto final de salud. Después de que pase, agregue recibos de frescura, estado de espera, efecto y resultado de acuerdo con el riesgo del flujo de trabajo. Este límite es también la razón por la que el experimento del artículo no compara Honeycomb con otro proveedor. La decisión del lector es más temprana y más concreta: ¿Puedo confiar en la conversación y la atribución de agente que estoy a punto de investigar? Sidewisp se encuentra actualmente en versión preliminar privada. Está destinado a agregar una capa de salud alrededor de los tiempos de ejecución de los agentes existentes, pero la recopilación de agentes de producción salud, los adaptadores Honeycomb y la recuperación automática no se envían en el repositorio actual del sitio web. Si está definiendo el límite de pruebas para sus agentes ahora, la lista de espera de vista previa privada es la manera adecuada de compartir esa necesidad de integración. Fuentes Córdoba de miel: agentes instrumentales AI El agente Timeline . OpenTelemetry Convenciones semánticas de agentes GenAI en el compromiso inspeccionado