2026-08-01T12:22:40.744Z
Grafana LLM Observabilidad: prueba la capa de resultado
Implemente la generación de Grafana y los caminos de OpenTelemetry, luego audite el tiempo de ejecución, espera, efecto y pruebas de destino antes de llamar a un agente saludable.
La observabilidad de Grafana LLM puede darte una cuenta sólida de las llamadas de modelo, generaciones de agentes, rastros, actividad de la herramienta, latencia, tokens, costo y evaluaciones. No puede, por sí solo, demostrar que un agente era accesible cuando se esperaba, esperaba a la persona adecuada, aplicó un efecto externo exactamente una vez, o produjo el producto solicitado. Por lo tanto, el defecto práctico es de dos partes: utilizar Grafana para la telemetría que documenta, luego añadir un pequeño contrato de pruebas operativas para las preguntas que la telemetría no responde. Prueba esas partes por separado. Una conversación que aparece en Grafana no es prueba de que llegaron rastros y métricas, y un rastro limpio no es prueba de que el destino cambió. Esta guía implementa ese límite con la documentación actual de Grafana y el paquete JavaScript @grafana/agento11y . También incluye una auditoría de siete casos que hace ejecutable la regla de aceptación en lugar de dejarla como asesoramiento en el tablero de instrumentos. Comience con el camino documentado, luego prueba en pedazos Grafana expone actualmente dos rutas relacionadas. Su AI Configuración de observabilidad general envía rastros, métricas y registros de OpenTelemetry a través de la puerta de entrada OTLP de Grafana Cloud por defecto; un Colector de OpenTelemetry o Grafana Alloy es la alternativa documentada cuando se necesita enrutamiento, transformación o mejor control a mayor volumen. Su nueva superficie Observabilidad del agente agrega generaciones orientadas a los agentes, conversaciones, llamadas a herramientas, pasos de flujo de trabajo, datos de tokens y costos, evaluaciones e integraciones de marco. Para JavaScript, el paquete actual es @grafana/agento11y . La etiqueta npm latest devolvió la versión 0.9.0 cuando se comprobó el 27 de julio de 2026. Trata eso como una instantánea de implementación fechada, no una recomendación de versión permanente. El comienzo más corto documentado se ve así: Luego configure el SDK a partir de variables de entorno en lugar de poner un token de acceso en la fuente: Los nombres de las variables de entorno pertinentes se documentarán como AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID y AGENTO11Y AUTH TOKEN . No imprima sus valores en registros ni los adjunta a rastros. Hay un límite fácil de perder en la Guía de instrumentación de JavaScript de Grafana: la exportación de generación y la exportación de OpenTelemetry no son el mismo camino. El SDK puede enviar datos de generación, pero necesita un TracerProvider y MeterProvider configurados por la aplicación para exportar los intervalos y métricas que emite. Sin esos proveedores, la guía dice que los rastros y las métricas se pierden silenciosamente. Eso hace que una conversación visible sea una prueba de configuración débil. Utilice tres sondas independientes en su lugar: 1. Crear una generación con un ID de prueba único y encontrarlo en Conversations . 2. Encuentra un intervalo con la misma identificación de correlación en la fuente de datos de rastros. 3. En la ventana de prueba, consulte una métrica emitida por el SDK y confirme que sus atributos de recursos identifican el servicio y el entorno esperados. Fallar la configuración si falta alguna sonda. No promedies los tres en una puntuación reconfortante: generation=yes, trace=no, metric=no es una telemetría parcial, no una instalación generalmente saludable. Un completo rastro de Grafana sigue siendo evidencia de actividad Grafana documenta una cobertura útil. Agent Observability puede capturar generaciones, llamadas a herramientas, pasos de flujo de trabajo, latencia, errores, tokens, costos, puntuaciones de calidad y comparaciones de versiones. Esas señales pueden responder preguntas como: ¿La llamada LLM falló o se desaceleró? ¿Qué modelo y versión de agente manejaron la fuga? ¿Qué herramientas se invocaron, y en qué rastro? ¿Cuántos tokens y cuánto costo atribuido consumió la carrera? ¿Una evaluación configurada o un guardia produjo un puntaje? El Convenciones de agentes de OpenTelemetry GenAI da a esa actividad un vocabulario portátil. En el momento de la investigación, las convenciones de agentes estaban explícitamente marcadas el estado de desarrollo e incluían operaciones para invocar un agente o flujo de trabajo, planificar y ejecutar una herramienta. El estado de desarrollo es importante: fije la versión de la instrumentación y espere que evolucionen los atributos o las formas de espacio. Ninguno de esos nombres define el resultado de tu negocio. Un execute tool span puede reportar una respuesta HTTP exitosa mientras el proveedor aplica la solicitud de manera asíncrona, la rechaza después de la validación o escribe al objeto equivocado. Un período de flujo de trabajo completo puede coexistir con un archivo faltante. Una evaluación de calidad puede marcar el texto generado mientras que una ejecución programada nunca comenzó. Utilice un mapa de pruebas que indique tanto la prueba como su límite: Avión de pruebas Puede establecer No establece Sonda de liberación Exportación de generación Una generación de modelos registrada alcanzó la observabilidad del agente Se exportaron rastros y métricas Encuentra una identificación de conversación única Las huellas Operaciones con instrumentos y su trayectoria causal El destino externo ahora tiene el estado previsto Pregunta sobre el lapso correlacionado Las métricas Indicaciones agregadas de tasa, duración, error, token y coste Una ejecución o entrega requerida ha tenido éxito Pregunta la ventana exacta de prueba Evaluación Un anotador nombrado corrió contra el material suministrado Una afirmación determinista de destino aprobada Retener la versión de puntuación y el alcance de la entrada Recibo de tiempo de ejecución El tiempo de ejecución era accesible y fresco en un momento esperado La tarea completada Compare la edad del latido cardíaco con su SLA Espera el recibo . Una pausa tiene una razón, propietario, fecha límite y manejo de la continuación El dueño decidirá a tiempo. Verificar el enrutamiento y la escalada Recibo de efecto Se puede reconciliar una operación externa El resultado completo del usuario está presente Leer de nuevo por ID de operación estable Recibo de resultados Se aprobó una afirmación específica del destino Estabilidad futura Reverificar durante una ventana de estabilidad Esto no es un argumento para subir más contenido. Prefiere IDs, timestamps, versiones, estados de baja cardinalidad, hashes, recuentos y afirmaciones de destino sobre las instrucciones en bruto, completos, cargas útiles de herramientas, secretos o vías de archivos. La telemetría rica y la minimización de datos son compatibles cuando el contrato se diseña antes de la instrumentación. Realizar la auditoría de cobertura de siete casos Convertí el mapa en una pequeña fijación determinista. Cada caso registra si la generación, rastreo y la exportación métrica tuvieron éxito; si la telemetría y el ritmo cardíaco de la carrera son frescos; si la carrera tiene una espera legítima; si un efecto externo fue reconciliado; y si el resultado esperado tiene un recibo autorizado. El clasificador aplica prioridad en lugar de aritmética: Los siete accesorios cubren: ninguna generación llegó; la generación llegó, pero no los intervalos y las métricas; toda la telemetría existe pero está obsoleta; el agente está esperando legítimamente con un propietario, fecha límite y token de continuación; un intento de herramienta no tiene efecto reconciliado; las pruebas de telemetría y de herramientas son verdes, pero falta el producto entregado; el mismo caso completado tiene un recibo de entrega autorizado. La repetición local pasó las siete clasificaciones esperadas: La comparación más útil es entre los dos últimos casos. Ambos tienen generación, rastreo y exportación métrica. Ambos están frescos. Ambos reportan la ejecución completada y el efecto de la herramienta verificado. El primero no tiene afirmación de destino y se clasifica false success ; el segundo agrega object:report 17 más un hash de contenido y se convierte en verified . Ese cambio es deliberadamente estrecho. Ningún panel de control, recuento de tokens, puntaje de modelo o cambios en el estado de rastreo. Sólo cambiarán las pruebas requeridas por la solicitud del usuario. La auditoría tiene una dura limitación: confía en los hechos que se le proporcionan. Un coleccionista malicioso o roto puede mentir, y un recibo del destino equivocado no es prueba. En la producción, generar recibos de resultados en el límite autorizado: una lectura después escritura de almacenamiento, una consulta de restricción de base de datos, una sonda de salud de implementación, una búsqueda del proveedor de mensajes enviados o otra afirmación determinista vinculada al ID de trabajo original. Convertir la cobertura en una puerta de aceptación de producción Ejecutar un canario con instrumentos antes de habilitar una nueva versión de agente, integración de marco, ruta de colección o cambio de muestreo. Dale al canario una identificación de trabajo única y un resultado esperado inofensivo. Luego, requieren todas las afirmaciones aplicables: Generación: la generación existe bajo el nombre de identificación canaria. Trace: el lapso de raíz y las operaciones infantiles requeridas son consultables. Metric: la ventana canaria contribuye a la serie esperada. Freshness: El retraso del colector se mantiene por debajo de un límite declarado. Tiempo de ejecución: un recibo de la frecuencia cardíaca o del programador demuestra que el tiempo de ejecución fue alcanzable cuando se esperaba. Espera: cualquier pausa nombra su razón, propietario autorizado, fecha límite de decisión, ruta de escalada y manejo de la continuación. EEffect: las operaciones de efecto secundario se concilian con una idempotencia estable o un ID de operación del proveedor. O Resultado: una verificación de destino autorizada demuestra la existencia del artefacto o estado solicitado. Privacy: la consulta de prueba confirma que los campos de respuesta, respuesta, secreto y ruta prohibidos están ausentes. Mantenga los veredictos incómodos. telemetry partial debe bloquear el despliegue de la instrumentación. health unknown debe evitar un estado verde cuando las pruebas están obsoletas. waiting debe notificarlo al propietario sin reiniciar el trabajo legítimo. uncertain effect debe detener los intentos ciegos. false success debe reabrir la tarea o el incidente incluso cuando el rastreo haya terminado normalmente. La toma de muestras requiere una decisión separada. Las huellas pesadas pueden ser muestras cuando el volumen lo requiera, pero los recibos de salud compactos necesarios para clasificar una carrera requerida no deben desaparecer con ellos. Mantenga suficientes identificadores para correlacionar las huellas de muestreo con los recibos de ejecución, espera, efecto y resultado no muestrados. De lo contrario, una política de telemetría más barata se convierte silenciosamente en una política de corrección más débil. También hay un coste operativo. Las lecturas de destino añaden latencia y llamadas del proveedor; los latidos cardíacos en tiempo de ejecución añaden comprobantes de almacenamiento y frescura; los recibos de espera requieren la propiedad del enrutamiento. Aplicar el menor control determinístico que resuelva la decisión. Una verificación de la existencia del archivo y hash es mejor que preguntar a otro modelo si el archivo probablemente existe. Un juez LLM sigue siendo útil cuando el resultado es semántico, pero registra su versión, rúbrica, alcance de entrada e incertidumbre junto a controles deterministas. Donde encaja Sidewisp Grafana es un lugar capaz de inspeccionar y correlacionar la telemetría. La capa que falta descrita aquí es el juicio operativo sobre la accesibilidad, el progreso, la espera, los efectos y los resultadosno otro espectador de rastro. El Sidewisp está destinado a convertirse en una capa de salud en torno a los tiempos de funcionamiento de los agentes existentes, con evidencia explícita, frescura, incertidumbre, límites de aprobación y verificación. No es una salida de tiempo de ejecución de reemplazo o un modelo obligatorio. Los adaptadores de monitoreo de producción y recuperación no se envían hoy. Sidewisp se encuentra actualmente en versión preliminar privada. Si este límite de evidencia coincide con la forma en que opera a los agentes, el siguiente paso apropiado es unirse a la lista de espera de vista previa privada y describir las comprobaciones de tiempo de ejecución y resultados que necesita. Hasta entonces, mantenga los veredictos de telemetría de Grafana precisos y adjunta la finalización a la prueba de destino que su trabajo realmente requiere.