2026-08-01T01:58:09.037Z
LangSmith LLM Observabilidad: prueba el árbol de rastreo a través de los servicios
Auditar un rastro LangSmith a través de los límites del servicio, capturar raíces divididas y extensiones huérfanas, preservar las esperanzas válidas, y requerir un resultado verificado.
LangSmith puede mostrar un conjunto limpio de intervalos exitosos y aún así dejar a un operador con la conclusión equivocada. Las pruebas faltantes pueden ser un trabajador cuyo rango nunca se unió al rastro, una segunda raíz creada después de un salto de servicio o un rastro completado sin prueba de que el artefacto solicitado haya llegado a su destino. El defecto práctico es simple: tratar la solicitud de agente aceptada de one como un árbol de rastreo de confianza , luego probar ese árbol con un manifiesto de servicio esperado. Un veredicto saludable requiere una raíz, vínculos parentales resueltos, las etapas de servicio esperadas, un nuevo progreso o una espera explícita, y un recibo de destino separado. La realización del rastro por sí sola no es la finalización de la tarea. Esta guía convierte esa regla en una auditoría de ocho casos para langsmith llm observabilidad . El dispositivo no contiene instrucciones, respuestas, secretos o cargas útiles de herramientas. Compara una regla ingenuo cada período dice OK con una decisión operativa más estricta y expone cinco casos verdes falsos. El predeterminado: preservar una raíz entre los saltos de servicio de confianza LangSmith define rastros como árboles de carreras, y su documentación distribuida de seguimiento describe cómo una solicitud puede continuar en todos los servicios. El servicio originario serializa el árbol de ejecución actual en un encabezado langsmith trace , con baggage opcional para metadatos y etiquetas. El servicio interno receptor restaura ese contexto y continúa el rastro. Ese es el estándar de implementación razonable para una API que entrega el trabajo a un planificador y luego a un trabajador. Da al operador un árbol causal en lugar de rastros locales no relacionados. La misma documentación pone un límite importante junto a la característica: esos encabezados son de confianza para rastrear el contexto. Un punto final público no debe aceptarlos como padres autorizados ni aceptar equipaje arbitrario de un solicitante no confiable. Despejelas en el borde, inicie una nueva raíz para la solicitud aceptada, y propague el contexto recién creado solo a través de saltos de servicio a servicio de confianza. Para cada solicitud aceptada, registre un manifiesto libre de contenido como: El requestKey debe ser un identificador opaco, no un nombre de cliente o de correo electrónico. El manifiesto es el denominador: sin él, un rastro no puede decirle que un servicio esperado no emitió nada. Estructura de auditoría antes de evaluar el estado del período Comience con la estructura porque una colección de espacios localmente exitosos todavía puede describir la ejecución equivocada. Aplicar estos controles en el orden siguiente: El chequeo Pruebas Estado de fallo Fronteras de confianza La raíz se creó después del borde público; el equipaje propagado vino sólo de un servicio interno UNTRUSTED CONTEXT El número de raíces Exactamente un mapa raíz de la solicitud aceptada SPLIT TRACE La integridad de los padres Cada parent run id sin raíz se resuelve dentro de la misma pista ORPHAN SPAN Cobertura del servicio Cada etapa de manifiesto requerida tiene al menos una carrera esperada TRACE GAP Frescura El trabajo abierto tiene un progreso reciente o una fecha límite de dependencia válida STUCK o WAITING El resultado El destino designado tiene un recibo determinista OUTCOME UNVERIFIED Veredicto final Pasaron todos los controles aplicables HEALTHY Este orden es importante. Si un llamador público puede suministrar equipaje de confianza, el árbol no es una prueba segura incluso cuando su forma es perfecta. Si existen dos raíces, comprobar a los niños bajo una sola raíz puede ocultar la mitad de la ejecución. Si la identificación de los padres no está presente, los sellos de tiempo no corregirán la brecha causal. No obligue a un rastro de carrera a incluir etapas que no haya alcanzado. La cobertura del servicio se evaluará en el límite del ciclo de vida correspondiente. Antes de que el planificador envíe el trabajo, la ausencia de un trabajador es normal. Después de completar los informes de ejecución, la misma ausencia es una brecha de rastreo. Guarde el hito del ciclo de vida junto al manifiesto en lugar de deducirlo solo del tiempo del reloj de la pared. Los retos también necesitan una regla explícita. Un segundo período de trabajo no es automáticamente un fallo duplicado. Registre una clave de operación estable y el número de intento, luego pregunte si el retiro se mantuvo bajo la misma raíz aceptada y si solo se cometió un efecto. Esta auditoría de árbol de rastro comprueba la cobertura causal; una auditoría de idempotencia o recepción de efectos maneja efectos secundarios duplicados. Reproduce ocho huellas incómodas El artefacto de investigación utiliza cuatro servicios necesarios api , planner , tool worker y verifier y reemplaza ocho casos: 1. un rastro distribuido completo con un artefacto verificado; 2. un período de tiempo de trabajo perdido; 3. un trabajador cuya identificación materna no esté presente; 4. dos raíces por una solicitud aceptada; 5. una nueva espera con un propietario y una fecha límite futura; 6. un trabajador abierto con progresos obsoletos; 7. un rastro completo sin recibo de destino; 8. equipaje aceptado de una fuente de propagación pública. Ejecutar el clasificador determinístico con Node: La fijación exacta producida: El resultado falsificable es la brecha entre seis verdes ingenuos y una carrera sana verificada. Cinco casos que contenían sólo ok , pero no lograron una verificación estructural, de confianza o de resultados. El trabajador obsoleto no era ingenuo porque se mantuvo abierto. La espera legítima también se mantuvo abierta, pero fue redirigida a WAITING en lugar de ser etiquetada erróneamente como un fracaso. Esto no significa que siete agentes fueron rotos. Significa que sólo un caso tenía suficiente evidencia para una conclusión saludable. WAITING es un estado operativo válido, y los estados de brecha identifican qué pruebas deben ser restauradas antes de decidir. Un clasificador compacto puede implementar la prioridad: La prioridad preserva la diferencia entre la actividad y el progreso útil. También impide que una condición verde posterior elimine una falla de evidencia anterior. Busca el árbol sin exportar contenido inmediato LangSmiths oficial Guía de consulta de SDK recomienda list runs o la API /runs/query . Documenta a is root=True para la selección de ejecución de raíz y a read run(..., load child runs=True) para hidratar un árbol candidato cuando un predicado infantil local necesita campos que los filtros del lado del servidor no exponen. Un camino mínimo de la colección de Python es: Adaptar la lista select a la SDK instalada. La instantánea de investigación observó la versión oficial de langsmith sdk V0.10.11, publicada el 28 de julio de 2026; verifique la referencia actual antes de copiar los nombres de campo en el código de producción. La auditoría no requiere inputs ni outputs . Cruza el árbol infantil hidratado y retenga sólo: Identificación de ejecutar y rastrear; Identificación de conducción de los padres; una etiqueta de servicio o escenario emitida por la solicitud; los tiempos de inicio, final y último progreso; el estado o la presencia de errores; llaves de operación opacas y llaves de solicitud; el propietario de espera y la fecha límite; el recibo de destino y el resultado de la verificación. El Descripción general de la observabilidad de LangSmith separa correctamente la investigación de rastreo, los paneles de control, las alertas, las automatizaciones, las evaluaciones en línea y la retroalimentación. Una auditoría de rastreo estructural complementa esas superficies; no sustituye a las evaluaciones ni afirma que cada falla sea visible a partir de los metadatos. Mantenga la espera, atrapado, y la verificación de resultados separados Un período prolongado no es suficiente para llamar a un agente atrapado. Requieren tanto una infracción de frescura como la ausencia de un contrato de espera válido. Un contrato de espera necesita un propietario, una dependencia y una fecha límite. En la fijación, el trabajador tenía un progreso reciente, esperaba a un revisor y llevaba un plazo futuro. El estado correcto fue WAITING . El trabajador obsoleto no tenía tal explicación y había superado la ventana de frescura de cinco minutos, por lo que se convirtió en STUCK . Ninguno de los dos estados es HEALTHY . Esperar necesita enrutamiento al propietario nombrado; trabajo atascado necesita investigación y tal vez una propuesta de recuperación limitada. No vuelva a intentarlo simplemente porque un rastro haya dejado de moverse, especialmente cerca de un límite de efectos secundarios. Por último, requieren pruebas fuera del rastro. Un período de verificación que terminó con éxito prueba que el código se ejecutó. No demuestra que exista el archivo solicitado, que haya llegado a la revisión prevista o que un mensaje haya llegado al destino previsto. Definir el recibo determinístico más fuerte disponible: un hash de objeto inmutable, una fila de base de datos más invariante, una revisión remota o una lectura de la API. La limitación es deliberada. Esta auditoría no puede reconstruir intervalos que nunca se emitieron, juzgar la calidad semántica a partir de metadatos, o demostrar un efecto herramienta sin un recibo producido por la aplicación. Puede mostrar que la evidencia es incompleta y evitar que la incertidumbre se vuelva verde. Sidewisp utiliza este mismo límite de salud en su dirección del producto: los rastros son evidencia, mientras que los progresos útiles y los resultados esperados requieren sus propios controles. Sidewisp se encuentra actualmente en versión preliminar privada. Su sitio en vivo es una experiencia de acceso temprano y una demostración interactiva; generalmente no se envían la recopilación de agentes de producción y la recuperación automática. Únete a la vista previa privada si quieres ayudar a dar forma a una capa de salud que funcione junto con los tiempos de ejecución existentes en lugar de reemplazar a LangSmith o tu pila de agentes.