2026-07-31T20:58:17.978Z

Splunk LLM Observabilidad: Mantenga las llamadas del evaluador fuera de la salud del agente

Audit Splunk evaluador aislamiento, telemetría histograma, cobertura de muestreo, cardinalidad, captura de contenido y prueba de resultados antes de confiar en una visión de agente verde.

La observabilidad de Splunk LLM puede mostrar un rendimiento útil, calidad, token, costo estimado y evidencia de rastreo para un agente instrumentado. Sin embargo, el defecto operativo seguro no es la página AI Agents está poblada, por lo tanto el agente está sano. Prueba primero que la tubería de medición está completa, que las llamadas del evaluador no se cuentan como trabajo de aplicación, que la cobertura de evaluación tiene un denominador conocido y que el resultado solicitado existe fuera del rastro. Esta guía construye esa prueba sin recoger indicaciones o respuestas. La fijación de ocho casos incluida produce un recibo sin contenido y las rutas se dirigen cada una a uno de estos estados: ingestión incompleta, discrepancia de contrato métrico, autoobservado por el evaluador, riesgo de alta cardinalidad, revisión de la política de contenido, cobertura de evaluación reducida, observable pero no verificada, o saludable con evidencia cubierta y verificada. Auditar la trayectoria de medición antes de leer la puntuación La documentación de configuración actual de Splunk hace que dos detalles de telemetría sean operacionalmente importantes. En primer lugar, se requieren métricas de histograma para las páginas de Vigilancia de Agentes AI. Cuando se utilice el exportador SignalFx, la configuración documentada del colector será send otlp histograms: true . La configuración también especifica la temporalidad delta a través de: Un rastro visible no demuestra que esta trayectoria métrica sea correcta: los intervalos y histogramas pueden fallar de forma independiente. En segundo lugar, la instrumentación Python AI puede ejecutar evaluaciones en el mismo proceso que la aplicación. Splunk documenta este interruptor, cuyo predeterminado es falso: En ese modo predeterminado, las llamadas LLM realizadas por evaluadores como DeepEval pueden ser instrumentalizadas junto con las llamadas de aplicación. Configurar las evaluaciones de ejecuciones reales en un proceso infantil con el SDK OpenTelemetry desactivado, evitando que las llamadas de los evaluadores contaminen la telemetría de las aplicaciones. Splunk marca este aislamiento como se requiere para la instrumentación OpenAI cuando las evaluaciones están habilitadas y opcionales para otros marcos documentados. Esa distinción cambia el significado de un gráfico. Supongamos que una invocación de agente llama a un modelo dos veces, entonces un evaluador hace tres llamadas de modelo más. Si el evaluador comparte el proceso instrumentado, un agregado ingenuo puede informar cinco llamadas, sus tokens combinados y su latencia combinada. La actividad adicional es real, pero no es evidencia de que el agente haya progresado más. Es un trabajo de medición que observa el trabajo de medición. Registrar un recibo sin contenido por despliegue: Ninguno de esos campos necesita un prompt, respuesta, argumento de herramienta, secreto o identificador de cliente. Describen la salud de la tubería de pruebas. Las tres primeras comprobaciones responden a diferentes preguntas: histogramsExported : ¿Exportó el Colector la telemetría del histograma requerida por las páginas de seguimiento AI? deltaTemporality : ¿El contrato de métricas coincide con la configuración documentada? aiSpanVisible : ¿al menos un nuevo genAI alcanzó la vista esperada de Splunk? No se desplome en un telemetry ok boolean. Si llegan los espacios pero no los histogramas, la investigación de rastreo puede funcionar mientras que los paneles agregados permanecen incompletos. Si los datos son antiguos, una página llena de gente puede seguir siendo obsoleta. Mantenga la fuente de pruebas y el tiempo de observación junto al recibo en una aplicación real. Dar a cada puntaje de calidad un denominador de cobertura Splunk describe una puntuación de calidad del agente AI como el porcentaje de evaluaciones que se aprobaron para una métrica. Su documentación AI Agents dice que se toman muestras para calcular esas puntuaciones, y una puntuación por debajo del 80% señala un problema de calidad. Esa puede ser una regla útil para la muestra evaluada. No es, por sí solo, prueba de que cada invocación elegible haya sido evaluada o de que la muestra represente cada tipo de tarea. Rastrear cuatro números juntos: 1. las plazos de solicitud elegibles; 2. la tasa de muestras de evaluación configurada; 3. los resultados completados de la evaluación; 4. disminución de la cola de evaluación. Para una ventana de auditoría determinista, calcular: Con 400 intervalos elegibles, una tasa de muestra de 0,25, 100 evaluaciones y cero caídas, la cobertura observada es del 25% y coincide con la expectativa configurada. Eso significa que Znot los otros 300 períodos pasados. Significa que su estado de evaluación está fuera de la muestra. La configuración Python de Splunk también expone un tamaño de cola de evaluación. Un límite positivo se aplica a la presión de retroceso; cuando la cola está llena, se lanzan nuevos elementos con una advertencia. La documentación recomienda un límite en el rango de 1001000 dependiendo del rendimiento y la memoria, mientras que cero o no establecido deja la cola sin límites. Cualquiera de las opciones tiene un compromiso: una cola ilimitada puede convertir el retraso de evaluación en presión de memoria; una cola limitada puede preservar el proceso pero reducir la cobertura de la evaluación; un contador de cola de seis significa que 94 evaluaciones completadas no pueden representar honestamente 100 evaluaciones elegibles a una tasa de muestra del 100%. La auditoría, por lo tanto, devuelve EVALUATION COVERAGE DROPPED , no saludable y no agente fallido. El agente puede haber completado un trabajo útil; la evidencia necesaria para el veredicto de calidad es incompleta. Las dimensiones métricas necesitan un límite similar. Splunk permite copiar los atributos de contexto de GenAI en dimensiones métricas, pero advierte explícitamente que gen ai.conversation.id puede causar problemas de alta cardinalidad. Mantenga la identidad de cada conversación en intervalos cuando sea necesario para el diagnóstico. No lo conviertas automáticamente en una dimensión métrica. Un entorno de despliegue de baja cardinalidad o nivel de inquilinos suele ser más seguro para la agregación; el conjunto correcto sigue dependiendo de los límites de tráfico y inquilinos. Mantenga contenido captura una excepción explícita La documentación del servicio LLM de Splunk dice que la recopilación de solicitudes y respuestas está desactivada por defecto y advierte que el contenido puede contener información sensible o de identificación personal. Su trayectoria de configuración también señala que las grandes entradas y salidas capturadas pueden exceder los límites de backend y causar problemas de rendimiento. Esta auditoría no necesita contenido. Puede verificar la exportación del histograma, la temporalidad, el aislamiento del proceso, la toma de muestras, las gotas, las dimensiones, la visibilidad de los rastros y un recibo de destino utilizando solo metadatos. Si una investigación de calidad independiente realmente requiere contenido capturado, realice una revisión de la política de contenido: identificar el evaluador exacto que necesita contenido; indicar si la captura se produce en intervalos, eventos o ambos; la retención, el acceso, el enmascaramiento y la eliminación de documentos; comportamiento de prueba de tamaño de carga útil; comprobar que las definiciones de herramientas no se capturan simplemente porque se habilitó la captura de mensajes; desactivar la captura después de la investigación limitada si no se justifica la recolección continua. El dispositivo devuelve CONTENT POLICY REVIEW cuando se habilita la captura sin un recibo de homologación. Ese veredicto deliberadamente no es sano ni roto. Dice que la instrumentación ha cruzado un límite de datos que el control de salud no puede autorizar. La misma restricción se aplica al coste estimado. Splunk afirma que su estimación de costos de agentes multiplica los costos publicados de los proveedores por el número de tokens disponibles y no representa la facturación real. Etiquetar la estimación, conservar la fecha de fijación de precios y no conciliarla silenciosamente con una factura o un descuento en caché específico para el proveedor. Realizar la auditoría de ocho casos de pruebas El artefacto reproducible utiliza una regla de prioridad. Los hallazgos anteriores bloquean estados verdes posteriores: Ejecutar la fijación guardada: Se repite ocho casos y devuelve ocho resultados distintos: Cobreado y verificado HEALTHY COVERED VERIFIED : Telemetría requerida, muestra declarada, caídas cero y acuerdo de resultados. evaluador autoobservado EVALUATOR SELF OBSERVED : Las llamadas del juez pueden ingresar a la telemetría de la aplicación. histogramas faltantes INGESTION INCOMPLETE : Un rastro no prueba que las métricas requeridas hayan llegado. ZError temporality METRIC CONTRACT MISMATCH : El contrato métrico exportado difiere de la configuración documentada. conversation id as metric HIGH CARDINALITY RISK : La identidad por conversación fue promovida a una dimensión métrica. Contenido captura no revisado CONTENT POLICY REVIEW : Se cruzó un límite de datos sensibles sin recibo. Evaluación en la cola de baja EVALUATION COVERAGE DROPPED : 94 resultados no pueden representar un esperado 100. trace without outcome OBSERVABLE NOT VERIFIED : Existen pruebas de ejecución, pero el resultado prometido no. Esta es una auditoría de configuración sintética, no una prueba de conformidad en vivo de Splunk. No puede demostrar que un colector es accesible, que una función incluye la capacidad requerida, que la retención cubre una ventana de incidencia o que un destino contiene el producto esperado. Reemplazar los valores de la fijación con observaciones de su entorno y conservar unknown cuando no se pueda medir un valor. Detener el rastro antes del veredicto de salud Las vistas de interacción de Splunk y AI responden a preguntas importantes sobre las operaciones del modelo, errores, uso de tokens, latencia y calidad de respuesta evaluada. Un veredicto de agente salud tiene un límite más: ¿se realizó el trabajo solicitado? Seleccione el control determinístico de destino más fuerte disponible: un archivo existe en el camino esperado y coincide con un esquema o hash; existe una solicitud de retirada en el repositorio esperado y el compromiso; un mensaje existe en el destino previsto con la clave de idempotencia esperada; una mutación de la base de datos es visible bajo el identificador de inquilino y operación previsto; un conjunto de ensayos aprobado contra el artefacto producido; una aprobación humana todavía está pendiente, por lo que la carrera es waiting , no fallido. Unir ese recibo al rastreo con un identificador de privacidad mínima. Mantenga el contenido disponible en su fuente. Un período exitoso más un recibo faltante es OBSERVABLE NOT VERIFIED ; no es un permiso automático para volver a intentarlo, porque el efecto externo puede existir pero ser temporalmente ilegible. La regla práctica es simple: confiar en la visión de Splunk después de que su propio camino de medición pase, interpretar las puntuaciones de calidad dentro de su cobertura conocida, y dejar claro la salud del agente solo cuando el resultado previsto se verifique por separado. Sidewisp sigue la misma orientación del producto de primera evidencia: distinguir la actividad de los avances útiles, exponer las pruebas faltantes y mantener la verificación de resultados separada de la finalización de los rastros. Sidewisp se encuentra actualmente en versión preliminar privada. Sus adaptadores de monitoreo de producción y motor de recuperación no se presentan aquí como disponibles en general; el sitio público es una experiencia de acceso temprano y una demostración de productos. Fuentes Configurar AI Seguimiento del agente, documentación de la nube de observabilidad de Splunk. Configurar el agente Python para aplicaciones AI 0.1.14 y superiores, documentación de la nube de observabilidad de Splunk. Monitorear los agentes AI, actualizado por última vez el 16 de junio de 2026. Monitorear los servicios de LLM, actualizado por última vez el 12 de mayo de 2026.