2026-08-01T01:58:04.640Z

LLM Observabilité: vérification du contrat d'agent

Testez le regroupement des conversations, l'attribution des agents, la corrélation des outils et la propagation des erreurs avant de faire confiance à la Timeline de l'agent Honeycomb.

Honeycomb peut montrer une chronologie polissée de l'agent et encore travailler à partir d'un contrat d'événement rompu. Avant d'utiliser cette vue pour diagnostiquer un incident multi agent, vérifiez six choses dans les intervalles émis: une identité de conversation, des noms d'agents distincts, l'attribution d'invocation côté appelant, les noms d'opération reconnus, les identifiants d'appel d'outil stables et les erreurs propagées. Le test pratique n'est pas est ce que la télémétrie est arrivée? Est ce que ces champs peuvent projeter le travail dans la bonne conversation, la voie de l'agent, l'opération et l'état de défaillance? L'audit ci dessous répond à cette question plus étroite avec huit appareils sans contenu. not recueille t il des informations ou prétend il qu'une chronologie propre prouve le résultat externe demandé. Ce que l' Agent Honeycomb Timeline projette réellement Honeycomb documente Agent Timeline comme une vue sur des conversations entières qui peuvent couvrir plusieurs traces. La clé de conversation est gen ai.conversation.id . À l'intérieur d'une conversation, les intervalles de GenAI sont regroupés par gen ai.agent.name , puis présentés sous forme d'invocations d'agent, d'opérations LLM et d'appels d'outils selon gen ai.operation.name . Cela rend la vue utile, mais elle fait également de plusieurs champs fournis par l'application une partie de la frontière diagnostique: Le gen ai.conversation.id décide quelles sont les sphères qui se rejoignent. Le gen ai.agent.name décide quel agent possède une voie. gen ai.operation.name décide si une durée est traitée comme un chat, une invocation d'agent ou une exécution d'outil. gen ai.tool.call.id permet à un opérateur de corréler une demande d'outil à son résultat. Les champs de statut d'erreur et d'exception déterminent si une défaillance est visible à l'intervalle affecté et à son parent. Le guide d'instrumentation de Honeycomb marque l'identifiant de conversation, le nom de l'agent et le nom de l'opération comme requis pour sa vue de l'agent. Il indique également qu'un nom d'agent manquant apparaît comme Unknown , et que les noms dupliqués empêchent les opérateurs de distinguer les agents lors d'une enquête. Le même guide explique explicitement une règle d'attribution facile à manquer: l'agent calling émet l'espace invoke agent . L'agent appelé émet son propre chat , execute tool , et d'autres spans sous son propre nom unique. Si une transformation de collecteur attribue l'invocation à l'appelant, la chronologie peut contenir chaque intervalle qui raconte la mauvaise histoire causale. C'est un problème de conformité de schéma avant qu'il ne soit un problème de tableau de bord. En demandant plus fort, on ne peut pas récupérer une identité qui n'a jamais été émise ou corriger un nom d'agent partagé par deux travailleurs. Audit du contrat de projection avant un incident Le dispositif complémentaire contient huit petits ensembles d'espace. Aucune ne contient des instructions, des réponses, des arguments d'outils, des identifiants de clients ou des secrets. Les seules valeurs sont les identifiants de conversation synthétiques, les instances d'agent, les noms d'agent, les noms d'opération, les liens parentaux, les identifiants d'appel d'outil et les champs d'état. Exécuter l'audit à partir du répertoire des objets: Le classificateur applique les contrôles dans l'ordre causal: 1. Tous les espaces de la conversation proposée doivent partager une pièce d'identité non vide. 2. Chaque sphère doit avoir un nom d'agent non vide. 3. Un nom d'agent affiché ne doit pas appartenir à plusieurs instances d'agent. 4. Un espace invoke agent doit être détenu par l'appelant. 5. L'opération doit appartenir à l'ensemble d'opérations génAI documenté utilisé par la projection. 6. Un espace execute tool doit conserver un identifiant d'appel à l'outil. 7. Une erreur d'enfant ne doit pas être inférieure à celle d'un parent qui rapporte toujours du succès. L'ordre compte. Si une conversation est déjà divisée entre conv 201 et conv 202 , le comptage des voies d'agent à l'intérieur de l'un ou l'autre fragment donne une réponse précise à la mauvaise question. De même, si deux processus s'appellent tous les deux worker , la corrélation appel outil ne peut pas restaurer l'identité de l'agent manquant. Les règles sont intentionnellement plus strictes que Honeycomb rendu quelque chose. Une vue rendue est une observation. Une enveloppe d'espace conforme est la preuve que l'observation a été regroupée et attribuée selon un contrat déclaré. Huit appareils exposent sept faux verts différents La règle de la comparaison naïve ne vérifie que que que chaque période a une pièce d'identité de conversation. Il accepte les huit fixesy compris le cas où deux identifiants non vides différents divisent une conversation logique. L'audit de conformité accepte exactement un: Les pièces d'étanchéité Vérifiez l'identité naïve Verdict de conformité Réparation requise une conversation valide passe CONFORMANT aucun une conversation fragmentée passe FRAGMENTED CONVERSATION propager un identifiant de conversation à travers les frontières de trace agent inconnu passe UNKNOWN AGENT émettre un nom d'agent stable et non vide collision agent nom passe AGENT NAME COLLISION donner à chaque instance d'agent un nom opérationnel distinct attribution d'invocation erronée passe INVOKE ATTRIBUTION INVALID émet invoke agent depuis l'appelant exploitation non reconnue passe OPERATION UNRECOGNIZED remap à une opération de génAI documentée identifiant d'appel d'outil manquant passe TOOL CALL UNCORRELATED préserver l'identifiant d'appel à travers la demande et le résultat erreur d'enfant caché passe ERROR PROPAGATION BROKEN propager le statut d'échec au parent Chaque verdict protège une décision différente de l'opérateur. Une conversation fragmentée cache le travail. Un nom inconnu ou en conflit corrompt la propriété. L'attribution d'invocation erronée inverse qui a délégué à qui. Une opération non reconnue met un événement dans la mauvaise catégorie visuelle. Un numéro d'identification manquant rend une pause dangereuse à réconcilier. Une erreur d'enfant cachée transforme un cheminement échoué en un parent qui semble réussir. Le dernier cas mérite une attention particulière. Honeycomb conseille d'enregistrer les erreurs de manière cohérente et de propager une défaillance de l'appel à l'outil à l'intervalle parent. Cette propagation ne prouve pas si un effet secondaire externe a été commis; elle empêche le parent de rester silencieusement vert pendant que l'enfant est connu pour avoir échoué. Pour les outils efficaces, ajoutez un reçu de destination séparé après ce contrôle de télémétrie. Un délai plus aucune réponse est un effet incertain, pas l'autorisation de réessayer. Le calendrier de l'agent peut aider à localiser l'appel ambigu; la destination autorisée doit décider si l'effet existe. Transformer l'audit en un canary de déploiement Appliquez le dispositif localement d'abord, puis adaptez une conversation canarienne inoffensive à votre trajectoire d'instrumentation. Gardez le contenu canarien libre et faites en sorte que sa topologie soit évidente: un agent de routeur invoque un travailleur; le travailleur effectue un appel à l'outil inoffensif; chaque espace reçoit le même identifiant de conversation synthétique; le routeur et le travailleur ont des noms distincts; l'invocation appartient au routeur; l'appel à l'outil conserve un identifiant d'appel synthétique; une variante de test échoue délibérément à l'outil et vérifie que le parent n'est plus efficace. Comparer l'enveloppe émise avant l'exportation et après toute transformation du collecteur OpenTelemetry. Cela provoque une défaillance de limite commune: l'instrumentation de source est correcte, mais une transformation renommée s'étend, laisse tomber un attribut ou assigne un nom d'agent statique à chaque processus. Pin cette transformation. Les conventions sémantiques d'agent OpenTelemetry GenAI inspectées pour cet article sont marquées Development , donc une mise à niveau SDK ou Collector n'est pas un changement visuel de routine. C'est un changement de schéma qui devrait réinitialiser le canary. Utilisez un petit enregistrement d'acceptation pour chaque libération: Ne mettez pas dans cet enregistrement des requêtes, des réponses, des arguments sur les outils ou des résultats des outils. Honeycomb note que le contenu du message peut contenir des PII et recommande de placer ce contenu dans des événements de durée où un collecteur peut le filtrer. Le canary de conformité a besoin d'identités et de statut, pas de contenu de conversation. Où cet essai s'arrête La réussite de l'audit signifie que l'enveloppe de portée fournie peut être projetée de manière cohérente dans la chronologie de l'agent Honeycomb. Il n'est pas établi que: chaque étendue atteint Honeycomb; l'échantillonnage a conservé la défaillance critique; un agent fait des progrès utiles; une attente humaine légitime a un propriétaire et une date limite; un effet secondaire de l'outil commis exactement une fois; l'existence du fichier, du billet, du déploiement ou du rapport promis; la réponse est factuellement ou sémantiquement correcte. Ce sont des questions de santé séparées. Traitez la conformité à la chronologie comme le ticket d'entrée pour le diagnostic, pas le verdict final de santé. Après son passage, ajoutez la fraîcheur, l'état d'attente, l'effet et les reçus de résultats selon le risque du flux de travail. Cette limite est aussi la raison pour laquelle l'expérience de l'article ne compare pas Honeycomb avec un autre fournisseur. La décision du lecteur est plus précoce et plus concrète: Puis je faire confiance à la conversation et à l'attribution de l'agent que je suis sur le point d'enquêter ? Sidewisp est actuellement en préversion privée. Il est destiné à ajouter une couche de santé autour des temps d'exécution existants des agents, mais la collecte des agents de production santé, les adaptateurs Honeycomb et la récupération automatisée ne sont pas expédiés dans le référentiel du site Web actuel. Si vous définissez maintenant la limite des preuves pour vos agents, la liste d'attente d'aperçu privé est le moyen approprié de partager ce besoin d'intégration. Les sources Céréales de miel: agents à instrumentation AI Le timeline de l'agent OpenTelemetry Conventions sémantiques d'agent GenAI à l'égard de l'engagement inspecté