2026-08-01T03:55:21.380Z

Azure LLM Observabilidad: Auditoría de la brecha verde recogida en la muestra

Prueba de frescura, visibilidad de RBAC, cobertura de evaluación, espera legítima y recibo de destino antes de tratar una fundición verde como saludable.

La observabilidad de Azure LLM debería responder a más de ¿Ha terminado una carrera? Antes de aceptar un veredicto saludable, compruebe cuatro condiciones para la misma carrera: la telemetría es consultable y fresca, el estado de ejecución se entiende, cada verificación de calidad requerida realmente cubre la carrera, y el resultado prometido existe en su destino. Microsoft Foundry le da piezas útiles de esa evidencia. Puede colocar rastros del lado del servidor en Azure Monitor Application Insights, mostrar métricas operativas en el Dashboard de Monitoreo de Agentes y ejecutar evaluaciones en función de las respuestas de producción muestras. Esas piezas no son intercambiables. Un rastro puede ser fresco mientras un evaluador saltó la carrera. Un evaluador puede pasar mientras un archivo, boleto, despliegue o mensaje nunca llegó a su destino. Una carrera completa también puede estar esperando una decisión humana legítima que la aplicación modelo mal. El incumplimiento práctico es, por tanto, una auditoría de cobertura, no una puntuación compuesta. Mantenga disponibles las pruebas no disponibles, trate el muestreo como cobertura en lugar de éxito, y deje que un recibo de resultados específico de la carga de trabajo cierre la brecha final. Lea las superficies de la fundición como evidencia separada Vista general de la observabilidad de Microsoft separa tres capacidades: Tracing registra el camino de ejecución, incluidas las llamadas de modelo, el uso de herramientas, la latencia y las franjas relacionadas. Monitoring resume medidas operativas como tokens, latencia, tasa de error y éxito de ejecución. Evaluación mide propiedades de calidad o seguridad seleccionadas con evaluadores incorporados o personalizados. Esa separación importa durante un incidente. Un período de tiempo exitoso establece que una operación con instrumentos alcanzó un estado terminal. No establece que el panel actual pueda ver todos los intervalos pertinentes, que un evaluador haya examinado esta respuesta o que haya ocurrido el efecto secundario solicitado. Las fundiciones Guía de configuración de seguimiento hacen explícitas dos límites útiles. Primero, el rastreo del lado del servidor del agente alojado comienza después de que el proyecto se conecte a Application Insights. En segundo lugar, las nuevas huellas pueden tardar unos minutos en aparecer. Si el rastro esperado está ausente, el veredicto responsable no es failed o healthy. Se trata de evidence no disponible hasta que se distingue la conexión, la autorización, el retraso de ingestión, la toma de muestras e instrumentación. La consulta de acceso es otra condición independiente. La documentación de monitoreo de Foundry requiere un acceso adecuado basado en funciones de Azure a Application Insights y, para las vistas de registro, al espacio de trabajo asociado de Log Analytics. Un operador que puede abrir el proyecto pero no puede consultar su telemetría protegida tiene un problema de visibilidad, no evidencia de un agente saludable. La misma advertencia se aplica a la pestaña Monitor. El Guía del tablero de control de seguimiento del agente describe la tasa de éxito de ejecución, tokens, latencia y resultados de evaluación. También se dice que la evaluación continua se realiza sobre las respuestas sampladas . La toma de muestras es una decisión válida de coste y rendimiento, pero crea una pregunta denominadora: ¿recibió esta carrera en particular todas las evaluaciones necesarias para la decisión que está tomando? No respondas a esa pregunta con un puntaje agregado. Graba por cada carrera. Dar una carrera un registro de cobertura Comience con un pequeño disco sin contenido. Mantenga identificadores o hashes que permitan a un operador autorizado encontrar la evidencia subyacente; no copie las instrucciones, argumentos de herramientas, secretos o resultados de modelos en una nueva tienda de salud. Cada campo responde a una decisión: 1. ¿Puede el operador recuperar la telemetría actual? Prueba la conexión de Application Insights y el permiso de consulta real. La carga de páginas del portal no es la prueba. 2. ¿El rastro es lo suficientemente fresco para este flujo de trabajo? Establecer un presupuesto basado en la duración prevista de las carreras más el retraso observado en la ingesta. No vuelva a utilizar silenciosamente el espacio verde de ayer. 3. ¿Qué está haciendo el agente? Preserva working , waiting , succeeded , y estados de falla. Una aprobación denominada o dependencia externa es una espera, no un estancamiento. 4. ¿El evaluador requerido cubre esta carrera? 5. ¿Se produjo el resultado prometido? Consultar el destino que posee el resultado. El resultado debe coincidir con el trabajo. Para un informe generado, verifique que el objeto esperado existe y que su hash o esquema es correcto. Para una actualización del boleto, lea el boleto y compruebe el estado de transición previsto. Para una mutación de API, consulta el recurso objetivo en lugar de confiar en el exitoso intercambio HTTP del cliente. Para una tarea de código, requiere la diferencia esperada más el resultado de la construcción o prueba correspondiente. Este registro evita deliberadamente un campo universal de éxito. Combinando evidencia diferente demasiado temprano es cómo la cobertura desconocida se vuelve verde. Repite la decisión antes de las alertas de cableado El dispositivo utilizado para este artículo contiene ocho ejecuciones sintéticas y no tiene credenciales de Azure, instrucciones o telemetría de producción. Su clasificador evalúa la visibilidad antes del estado de ejecución, el estado de ejecución antes de la calidad y la calidad antes del resultado: El funcionamiento de node audit azure observability.mjs contra la fijación fija produjo ocho coincidencias y ninguna desincordancia: El caso Evidencias de la parte de Azure Prueba de destino El veredicto Conexión presente, consulta rechazada No puedo inspeccionar la telemetría actual Presente de recibo EVIDENCE UNAVAILABLE Vieja pista, todos los demás campos verdes Estilos Presente de recibo EVIDENCE STALE Traza fresca, activa Actividad actual No se espera todavía WORKING Traza fresca, espera de aprobación nombrada Esperanza actual No se espera todavía WAITING Se ejecutó con éxito, se omitió la evaluación requerida Ausencia de cobertura de calidad Presente de recibo QUALITY UNKNOWN Se ejecutó con éxito, la evaluación muestrada falló Calidad fallida Presente de recibo QUALITY FAILED Se ejecutó y evaluó con éxito Completo en la fundición Incompatibilidad con el recibo FALSE COMPLETE Se ejecutó y evaluó con éxito Completo en la fundición Presente de recibo HEALTHY Dos resultados son fáciles de manejar mal. QUALITY UNKNOWN no es un evaluador fallido. Dice que el evaluador no cubrió la carrera requerida para esta decisión. Puede dirigir ese estado a un sustituto determinista, una evaluación única cuando sea apropiado, o una revisión humana. No se puede cambiar de etiqueta el puntaje agregado del tablero como resultado de esta ejecución. WAITING tampoco es un fracaso. Si el rastro es fresco e identifica a un propietario legítimo y a una dependencia, la acción útil es sacar a la superficie la espera para ese propietario. Reiniciar el agente puede duplicar el trabajo o descartar el contexto sin resolver la dependencia. Establezca alertas sobre la condición fallida, no el color Una alerta debe nombrar las pruebas que se rompieron: Telemetría no disponible : verifique la conexión Foundry to Application Insights, consulta RBAC, acceso a tablas protegidas, instrumentación y tráfico reciente. EEvidencia estable : compara el último tiempo de seguimiento observado con el presupuesto de frescura del flujo de trabajo y el retraso de ingestión conocido. Qualidad desconocida : inspeccionar la tasa de muestra configurada y si esta decisión requiere realmente un evaluador. Quality failed : conserve el nombre del evaluador, la versión, el umbral y el identificador de la ejecución probada antes de investigar. False complete : detenga los retos automáticos en el límite del efecto secundario y concilien el destino mediante un identificador de trabajo estable. Esto produce operaciones más silenciosas que una alerta en cada muestra ausente o de larga duración. La orientación del panel de control de Microsoft ofrece amplios umbrales de investigación, como la búsqueda de tasas de éxito de ejecución bajas o de alta latencia. Esas señales de la flota son útiles para encontrar una cohorte. El registro de cobertura por carrera decide lo que está mal con una pieza particular de trabajo. La frescura también necesita un dueño. La retención de Application Insights controla cuánto tiempo permanece la evidencia consultable; los permisos de ingestión y consulta controlan si es visible ahora. Almacenar el último tiempo de consulta exitoso y el último tiempo de seguimiento correspondiente por separado. El panel cargado no prueba nada. Mantenga la vista previa y los límites de privacidad visibles La documentación actual de la fundición marca partes del rastreo y monitoreo de agentes como vista previa. El Descripción general de los agentes dice que el rastreo está generalmente disponible para los agentes rápidos y alojados, mientras que el rastreo de flujo de trabajo y el rastreo de agentes externos están en vista previa. La guía de seguimiento también marca las características del tablero de instrumentos como vista previa. Registrar el tipo de agente y el estado de las características en la libreta de ejecución; no transferir las garantías de una ruta de agente alojado a un flujo de trabajo externo sin verificar el contrato en curso. El rastreo puede capturar las instrucciones, las salidas, los argumentos de la herramienta y los resultados de la herramienta. Microsoft recomienda eliminar contenidos sensibles antes de llegar a la telemetría y aplicar controles de acceso y retención en producción. Una capa de salud debe hacer referencia a la evidencia con identificadores libres de contenido cuando sea posible, no crear una segunda reserva de cargas útiles sensibles. Hay una última limitación que debe mantenerse fuera del veredicto: este clasificador prueba la precedencia de la evidencia. No se pone en contacto con una suscripción de Azure, no se deduce un objetivo de nivel de servicio de ingestión ni decide qué significa éxito para su aplicación. El recibo de destino es deliberadamente específico de la carga de trabajo. Ese límite es el punto. La observabilidad de Azure LLM puede exponer la ejecución, el rendimiento, la calidad de la muestra y la evidencia de depuración. La salud operativa también requiere frescura, cobertura, estado de espera correcto y prueba del resultado esperado. Sidewisp se encuentra actualmente en versión preliminar privada. Su dirección es transformar la evidencia de los tiempos de funcionamiento de los agentes existentes en una visión clara de la salud mientras se preserva la incertidumbre y los límites de aprobación humana; el monitoreo de Microsoft Foundry no se presenta aquí como una integración Sidewisp enviada.