2026-08-01T01:57:54.067Z
Datadog LLM Experimentos de observabilidad: añadir una puerta de promoción
Impresión digital en la comparación, prueba la cobertura de fila, preserva las expectativas válidas y bloquea los efectos faltantes o duplicados antes de la promoción.
Los experimentos de observabilidad de Datadog LLM pueden decirle que una arquitectura de candidato, modelo, proveedor o agente obtuvo mejores puntajes y funcionó más rápido. Esa es una evidencia útil, pero aún no es una decisión de liberación. El defecto razonable es comparar el candidato y la línea de base dentro del mismo proyecto Datadog, fijar la versión del conjunto de datos, mantener estables las definiciones del evaluador e inspeccionar la distribución y los rastros en lugar de confiar en un promedio. Luego añadir una pequeña puerta de promoción fuera de la tarjeta de puntuación: demostrar que cada registro requerido se ejecutó, las esperanzas esperadas permanecieron esperanzas, los casos mutantes produjeron exactamente un efecto, y los casos completados tienen un recibo de destino. Este artículo implementa ese último paso con una fijación de ocho registros. El candidato cambia la tasa de aprobación del evaluador de 75% a 100% y la duración media de 980 ms a 738,75 ms . La promoción todavía está bloqueada. Una restitución no tiene recibo de destino verificado, y una cancelación produjo dos efectos. Primero demuestra que los dos experimentos son comparables La descripción general de los experimentos de Datadog describe tres operaciones principales: conjuntos de datos de versiones, ejecutar experimentos y comparar resultados. El actual documentación de instalación define un experimento como una tarea ejecutada secuencialmente en registros de conjuntos de datos, con evaluadores de registros y evaluadores opcionales de resumen. Los internos de tareas pueden utilizar los mismos decoradores de rastreo que el código de producción. Esos primitivos te dan un buen material para una comparación. No eliminan la necesidad de definir lo que debe permanecer idéntico entre las dos carreras. Antes de mirar las puntuaciones, graba un manifiesto libre de contenido: Los hashes identifican el código del evaluador; no son hashes de instrucciones, salidas, credenciales o datos de clientes. Hash la serialización canónica JSON de este manifiesto y adjunta la huella digital a ambos registros del experimento. El dispositivo produce: Si las huellas dactilares difieren, deje de llamar al resultado una comparación en pareja. Una versión modificada del conjunto de datos puede agregar casos difíciles. Un evaluador cambiado puede mover el umbral. Un registro faltante puede mejorar un promedio eliminando el fracaso que importa. Esos cambios pueden ser legítimos, pero requieren una nueva línea de base. el paso del producto de Datadog dice que los conjuntos de datos admiten el control de versiones y se pueden fijar en versiones específicas. También explica que la superficie de comparación expone los promedios, las distribuciones, la latencia, el costo, el recuento de tokens, las salidas y los rastros de lapso. Usa todo eso. El manifiesto no reemplaza la evidencia de Datadog; evita la deriva accidental de comparación antes de interpretarla. Ejecutar una puerta que puede estar en desacuerdo con los promedios El artefacto inspectable para este artículo es un script Python de biblioteca estándar. Contiene ocho registros sintéticos libres de contenido y emite JSON. Ejecutar con: La regla central es deliberadamente pequeña: Esto no pregunta a un segundo modelo si el primer modelo parecía exitoso. Verifica campos explícitos cuyo significado controlas. Los rendimientos de la fijación completa: Medidas Línea de base El candidato : : Registros presentes 8/8 8/8 Taxa de aprobación del evaluador 75% 100% Duración media 980 ms 738,75 ms Bloqueo de registros — 2 Decisión de promoción — Block El Guía para desarrolladores de evaluación de Datadog admite los resultados de los evaluadores tipografados, una evaluación opcional de aprobación/fallo, metadatos, etiquetas y evaluadores de resumen. Eso hace que un evaluador sea una fuente adecuada para evaluatorPass . No convierte a todos los evaluadores en verificadores de destino. Si su evaluador compara el texto generado con una respuesta esperada, puede pasar mientras el reembolso nunca llega al libro mayor. Mantenga estos carriles de pruebas separados: Ecamera de evaluación: ¿La salida cumple con la regla de calidad elegida? ZLano de seguimiento: ¿Qué LLM, pasos de recuperación, herramienta y tarea se ejecutaron, y con qué errores o latencia? Lanzón de estado: ¿Fue el caso funcionando, esperando legítimamente, completo, incierto o necesitando de una persona? EEfect lane: ¿Se produjo exactamente una vez la mutación externa prevista? O: ¿El destino ahora contiene el resultado prometido? Las dos primeras vías son entradas naturales de los experimentos Datadog. Los carriles restantes provienen de su contrato de tareas, accesorios y sistemas de destino. Puedes enviar sus resultados como evaluaciones personalizadas o metadatos de experimentación, pero definirlos en el límite que posee la verdad. Los dos registros bloqueados revelan fallas diferentes El registro issue refund tiene un evaluador de paso, un estado complete y un efecto intentado. Su outcomeReceipt es missing . Esto no es evidencia de que la restitución haya fallado; es evidencia de que la finalización no ha sido verificada. El veredicto seguro es uncertain , no verde y no una nueva prueba automática. El registro cancel subscription tiene un evaluador de aprobación y un recibo de destino verificado, pero effectCount es de dos. Un estado final exitoso no borra el efecto duplicado. El candidato está bloqueado porque el cambio debilitó la seguridad incluso mientras mejora el puntaje agregado. El registro approval required muestra el límite opuesto. Su estado esperado es waiting , y el candidato suministra un token de propietario, fecha límite y continuación. Se pasa. Una pausa con una dependencia conocida no es un estancamiento, por lo que una puerta que requiere que cada fila termine en complete castigaría el comportamiento correcto. Estos casos son intencionalmente incómodos. Si una puerta de promoción solo repite la puntuación del evaluador, no puede cambiar la decisión de liberación. Una puerta útil debe ser capaz de decir: la comparación es inválida debido a que la cobertura registrada ha cambiado; el candidato es mejor en cuanto a la calidad, pero no seguro en cuanto a los efectos; el candidato es más rápido pero dejó un resultado desconocido; la espera es válida y no debe considerarse un fracaso; las pruebas conflictan, por lo que una persona debe decidir. Unen la puerta a un experimento real Datadog La guía de configuración actual de Datadog requiere ddtrace =4.3.0 para el camino documentado de Experimentos Python y requiere tanto una clave de API como una clave de aplicación. Mantenga esos secretos en variables ambientales; no los ponga en un manifiesto, una fila de conjuntos de datos, un artefacto de artículo o un atributo de rastro. Para un flujo de trabajo de experimento existente, agregue la puerta en cinco pasos limitados. 1. Congelar el contrato de comparación. Gravar el proyecto Datadog, la identidad y la versión del conjunto de datos, los ID de registro ordenados, los hashes de código evaluador, la revisión de tareas, la configuración de candidato y el estado esperado para cada registro. Almacenar sólo IDs opacos o hashes cuando el contenido es sensible. 2. Conciliar la cobertura antes de calcular una tasa. Comparar los registros de identificación esperados con los registros de experimentación observados. Las identificaciones faltantes, duplicadas o inesperadas no pueden ser comparadas. No reduzca silenciosamente el denominador a las filas que regresaron. 3. Emite campos deterministas en el límite de tarea. Para una tarea de solo lectura, el recibo puede ser una respuesta válida de esquema vinculada a la revisión de la fuente esperada. Para una tarea mutante, utilice una clave de idempotency, identidad de efecto y una búsqueda del lado de destino. Cuenta los efectos cometidos, no los intentos de volver a intentarlo. 4. Preservar estados no terminales. Un caso de espera necesita una razón, propietario, fecha límite y identidad de reanudación. Un caso de credenciales puede terminar correctamente como needs human . No fabrique una respuesta para facilitar una puntuación fuera de línea. 5. Promover sólo en conjunción. El candidato puede ser promovido cuando el manifiesto coincida, la cobertura es completa, los evaluadores requeridos aprueban, los presupuestos operativos se mantienen, cada estado coincide con su contrato, cada resultado completado se verifica, y cada caso de mutación tiene exactamente un efecto previsto. Un promedio ponderado no es un sustituto porque una puntuación alta puede compensar matemáticamente un solo efecto catastrófico. Una política práctica es: Ajustar los umbrales para las métricas de calidad, latencia y coste de los asesoramientos. Mantenga los recibos perdidos, efectos duplicados, exposición secreta y comparaciones inválidas como fallas difíciles a menos que su dominio proporcione una regla explícita más segura. Saber lo que esta auditoría no demuestra La fijación demuestra sus propios ocho casos y la aplicación de la regla. No demuestra que su conjunto de datos represente el tráfico de producción, que las salidas esperadas son correctas, que los hashes del evaluador corresponden al código revisado o que no se pueden falsificar los recibos de destino. Tampoco mide la calidad del producto de Datadog ni compara modelos. Dichas cuestiones requieren una revisión de los conjuntos de datos, un control de las fuentes, un control de acceso, un muestreo de producción y una reconciliación con el destino real. Los Experimentos Datadog siguen siendo el lugar para estudiar las carreras de los experimentos, las distribuciones, las huellas y los resultados de los evaluadores. La puerta de promoción añade una decisión operativa más estrecha: ¿esta comparación específica es lo suficientemente completa y segura como para autorizar el cambio? La dirección del producto de Sidewisp es facilitar la interpretación de la evidencia, la incertidumbre y la verificación de la salud de los agentes a lo largo de los tiempos de ejecución existentes. No reemplaza a Datadog, su tiempo de ejecución o su proceso de liberación. Sidewisp se encuentra actualmente en versión preliminar privada. El sitio público y la demostración interactiva son en vivo; la recopilación de agentes de producción y salud y la integración de Datadog generalmente no se envían.