2026-08-02T00:38:20.823Z
AI-Agent Beobachtbarkeit: Messen Sie nützliche Fortschritte, nicht nur Aktivität
Ein runtime-neutraler Fünfsignal-Rahmenwerk, um produktiven Agenten von legitimer Wartezeit, Ständen, unerreichbaren Runtimes und falschen Erfolgsergebnissen zu erzählen.
AI Agentobservabilität ist die Fähigkeit zu erklären, was ein Agent aus externen Beweisen getan hat: Spuren, Logs, Metriken, Werkzeugereignisse, Modellanrufe, Latenz, Token und Kosten. Dieser Beweis ist notwendig, aber es ist kein Gesundheitsurteil. Eine Spur kann vollständig sein, während die angeforderte Datei fehlt. Ein Tool Call kann erfolgreich sein, solange der Agent den gleichen Schritt wiederholt. Ein ruhiger Lauf kann richtig auf Genehmigung warten. Die praktische Antwort besteht darin, die Telemetrie zu behalten und eine kleine Entscheidungsschicht darüber hinzuzufügen. Beobachten Sie für jede Aufgabe fünf Dinge zusammen: Erreichbarkeit, nützliche Fortschrittsdelta, deklarierte Abhängigkeiten, deterministische Ergebnisprüfungen und Kosten über das gleiche Fenster. Beurteilen Sie sie in dieser Reihenfolge, bevor Sie etwas alarmieren oder wiederherstellen. Dieser Leitfaden verwandelt diese Regel in ein ausführbares Fünf Fall Festiment. Es ist absichtlich runtime neutral: Dieselbe Argumentation kann über OpenTelemetry Spans, Claude Code Ereignisse, ein OpenClaw Run Log oder ein benutzerdefinierter Agent liegen. Eine Spur beweist, was lief, nicht, was sich verändert hat. Die derzeitigen OpenTelemetry Semantikkonventionen für GenAI Agentenspannen definieren Operationen für die Erstellung und Anrufung von Agenten, die Anrufung von Workflows, Planung und Ausführung von Werkzeugen. Das Dokument ist Development gekennzeichnet, was bei der Gestaltung eines langlebigen Schemas wichtig ist: Verwenden Sie die Konventionen, wo sie passen, aber isolieren Sie versionsensible Attribute hinter Ihrer eigenen Normalisierungsschicht. Die Runtime Telemetrie wird bereits detailliert. Die Überwachungsdokumente des Claude Codes beschreibt Metriken, Ereignisse und beta verteilte Spuren. Sein Spurenbaum kann eine Interaktion, Modellanfragen, Tool Anrufe, blockierte Zeit bei einer Benutzerentscheidung und Tool Ausführung umfassen. Zu den dokumentierten Feldern gehören Dauer, Token, geschätzte Kosten, Werkzeug Ergebnisgröße und success . Diese Felder beantworten wichtige Fragen: Hat die Laufzeit reagiert? Welches Modell und welche Werkzeuge liefen? Hat ein bestimmter Werkzeugkörper einen Fehler zurückgegeben? Wie lange dauerte die Erlaubnis und die Hinrichtung? Wie viele Token und Dollar verbrauchte der Run? Sie definieren nicht den Erfolg Ihrer Aufgabe. Ein Shell Kommando, das den Ausgangscode 0 zurückgibt, beweist, dass der Kommando unter seinem eigenen Vertrag abgeschlossen wurde. Es beweist nicht, dass ein Artikel öffentlich ist, dass eine Sitemap seine URL enthält, dass eine Pull Anforderung die CI überträgt oder dass ein Kundendokument das beabsichtigte System erreicht hat. Anwendungen können diese Kontrollen hinzufügen, aber ein generisches Werkzeug Erfolgsfeld kann sie nicht erfinden. Aktivität und Fortschritt können sich daher in entgegengesetzte Richtungen bewegen. 19 erfolgreiche Tool Anrufe ohne Ausgabe Delta können eine Schleife sein. Zwei Tools, gefolgt von Schweigen, können eine gesunde Wartezeit für einen Kritiker sein. Eine letzte Nachricht mit der Aufschrift done könnte ein falscher Erfolg sein, wenn das versprochene Artefakt fehlt. Erstellen Sie ein Gesundheitsfenster aus fünf Signalen Wählen Sie ein Aufgaben spezifisches Beobachtungsfenster aus, bevor Sie das Ergebnis betrachten. Fünf Minuten können für eine kleine Codebearbeitung geeignet sein; eine Stunde kann für eine geplante Forschungsarbeit vernünftig sein. Vermeiden Sie eine globale Schwelle, die jeden langen Betrieb als festgehalten bezeichnet. In diesem Fenster sammeln Sie fünf Signale: Signal Mindeste Beweise Was sie verhindert Erreichbarkeit Herzschlagalter, Prozess /Sitzungsreaktion oder Scheduler Receipt eine unerreichbare Laufzeit als fehlgeschlagenes Argumentation zu behandeln Nützliche Fortschritte ein monotonisches, Aufgabenspezifisches Delta Wiederholte Aktivität für Bewegung zu verwechseln Abhängigkeit eingegriffener Wartegrund, Eigentümer und fällige Zeit Wiederholung einer Arbeit, die eine Person oder ein externes System legitim benötigt Ergebnis Deterministische Prädikate für das versprochene Ergebnis Annahme einer Vollendungsnachricht ohne Lieferwert Kosten Token, Anrufe, Zeit oder Geld im selben Fenster die teure Wiederversuche ignorieren, die keinen Fortschritt bringen Nutzliche Fortschritte müssen konkret sein. Bei einem Coding Agent kann es sich um ein verändertes Testresultat, ein neues Commit oder eine reduzierte Anzahl fehlerhafter Tests handeln. Für einen Verleger könnte es eine CMS Draft ID sein, dann ein öffentlicher API Match, dann eine Live URL in der Sitemap. Für einen Support Agent könnte es sich um einen validierten Ticket Übergang handeln und nicht um eine andere Modellreaktion. Es ist vorzugsweise ein deterministisches Ergebnispredikat, wenn es es gibt: Verwenden Sie einen Evaluator nur, wenn das Ergebnis nicht mechanisch überprüft werden kann, und speichern Sie seine Rubrik, Version und Unsicherheit. Versammeln Sie keine verborgene Gedankenkette als Abkürzung. Die Auswahl von Werkzeugen, explizite Pläne, Ausgänge, Zeitstempel und Änderungen des Zustands liefern operative Beweise, ohne dass private Argumente erforderlich sind. Kosten gehören ins Fenster, aber Kosten allein sind nicht Gesundheit. 10 Dollar, die eine verifizierte Migration erzeugen, kann erwartet werden. Fünfzig Cent, die man auf eine unveränderte Suche ausgibt, kann die Anomalie sein. Eine nützliche abgeleitete Maßnahme ist: Die max vermeidet die Spaltung durch Null; sie macht keinen gesunden Fortschritt. Sie müssen separat informiert werden, wenn progress delta == 0 und die Kosten weiter steigen. Arbeiten, warten, feststehen, unerreichbar und falschen Erfolg klassifizieren Entscheidungsordnung ist wichtig. Überprüfen Sie zuerst die Reichweite. Dann respektiere eine explizite Abhängigkeit, die noch in ihrer Zeit ist. Überprüfen Sie eine beanspruchte Fertigstellung mit dem Ergebnispredikat, bevor Sie sie akzeptieren. Erst dann interpretieren Sie den Fortschritt und die vergangene Zeit. Hier ist eine vollständige NDJSON Fixture. Speichern Sie es als health window fixture.ndjson : Führen Sie diesen Klassifikator mit Node.js aus: Erwartete Leistung: Die Festung macht die These falzierbar. Eine naive Regel wie tool calls 0 markiert sowohl run stuck als auch run false success als aktiv. Eine Regel, die nur auf Schweigen beruht, markiert run waiting als ungesund. Die Regel der fünf Signale trennt sie, weil sie Abhängigkeit und Ergebnisbeweise bewahrt. Das Beispiel ist ein Entscheidungsskelett, nicht ein universelles Scoring Modell. Der Produktionscode benötigt auch Frische, Vertrauen, Quelleidentität und einen uncertain Pfad, wenn Signale nicht übereinstimmen. Mappe jeden Zustand zu einer begrenzten Reaktion Die Klassifizierung besteht, um die falsche Handlung zu verhindern, nicht um ein Dashboard zu dekorieren. Staat Nachweis erforderlich Standard Antwort Arbeiten jüngste Erreichbarkeit und positiver Fortschritt delta lassen Sie es in Ruhe; Proben Sie später wieder. Ich warte abhängigkeit, Eigentümer und nicht abgelaufene Fälligkeitszeit den Verantwortlichen einmal mitzuteilen; den blockierten Schritt nicht erneut ausprobieren Ich stecke fest. Erreichbar, über sein Fenster hinaus, keine Abhängigkeit, keine Fortschrittsdelta Überprüfen Sie den wiederholenden Schritt; bereiten Sie einen reversiblen erneuten Versuch oder einen Schub innerhalb der Grenzen vor. Falscher Erfolg Erfüllung angegeben, deterministisches Ergebnis fehlgeschlagen öffnen Sie die Aufgabe wieder und melden Sie das fehlende Prädikat; nennen Sie es nicht abgeschlossen Nicht erreichbar Starrer Herzschlag oder fehlgeschlagener Kontakt Überprüfen Sie die Verfügbarkeit von Host/Runtime, bevor Sie Anweisungen ändern Unsicherheit fehlende oder widersprüchliche Beweise das fehlende Signal erfassen oder fragen; die Wiederherstellung nicht automatisieren Diese Trennung hat außerhalb von AI Systemen einen nützlichen Präzedenzfall. Kubernetes unterscheidet zwischen Start up Sonden, Lebensfähigkeit und Bereitschaftssonden weil der Prozess existiert und der Dienst Verkehr erhalten sollte sind unterschiedliche Entscheidungen. Seine Dokumentation warnt auch davor, dass schlecht gestaltete Lebensraumsonden durch unnötige Neustartungen zu Kaskadenfehlern führen können. Die Analogie hat eine Grenze: Ein AI Agent ist kein Pod, und nützlicher Fortschritt ist auf die Aufgabe abhängig. Die übertragbare Lektion ist enger, lassen Sie kein einziges zweideutiges grünes oder rotes Signal jede Intervention genehmigen. Zur aktiven Wiederherstellung sind der Aktion folgende Grenzwerte anzugeben: ein erneuter Versuch, nicht eine unbegrenzte erneute Versuchsschleife; eine maximale vergangene Zeit und Kosten; ein umkehrbarer Schritt; eine explizite Genehmigungsgrenze für zerstörerische oder externe Maßnahmen; eine Nach Aktionsprüfung der Fortschritte oder der Ergebnisse. Befehlsvollständigung ist keine Erholung. Der Vorfall wird erst nach einer Veränderung des erwarteten Zustands beseitigt. Das Instrument des Vertrages, nicht jeder Gedanke Eine kompakte, normalisierte Krankenakte kann neben Ihren vorhandenen Spurendaten sitzen: Beweiseverweisungen werden zugänglich kontrolliert und Geheimnisse, Anfragen, Rohwerkzeuglasten und absolute lokale Wege werden redigiert, es sei denn, dies ist streng erforderlich. Die gesundheitliche Aufzeichnung sollte aufzeigen, was geprüft wurde und wo autorisierte Betreiber sie überprüfen können; sie sollte keine zweite Kopie der sensiblen Telemetrie werden. Version vier Dinge explizit: 1. der Laufzeitadapter, der die Beweise normalisiert hat; 2. die Definition der Fortschritte; 3. das Ergebnisprädikat; 4. die Klassifizierungsregeln und Schwellenwerte. Ohne diese Versionen kann ein veränderter Testbefehl oder ein umbenanntes Lieferprodukt wie eine plötzliche Agentenregression aussehen. Wissen Sie, wo die Methode endet Der schwierige Teil ist, keinen weiteren Spannpunkt zu sammeln. Sie definiert den nützlichen Fortschritt und das versprochene Ergebnis ehrlich. Einige Aufgaben haben keine monotone Fortschrittsmessung. Ein Forschungsagent kann eine schwache Hypothese verwerfen und zu einem früheren Stadium zurückkehren; das kann wertvolle Arbeit sein, auch wenn ein Gegenstück fällt. Einige Abhängigkeiten zeigen keine zuverlässige Frist. Einige Ergebnisse erfordern eher Urteil als Prüfung. In diesen Fällen bewahren Sie die Beweise und melden Sie uncertain . Verwenden Sie keine Präzision mit einem universellen Gesundheitsscore. Auch die Online Gesundheitsüberprüfungen von der Offline Evaluierung trennen. Offline Datensätze können zeigen, ob eine neue Agent Version in bekannten Fällen genauer ist. Das Live Health Fenster beantwortet eine andere Frage: Ist dieser spezielle Lauf erreichbar, beweglich, rechtmäßig wartet oder verpasst sein Ergebnis jetzt? Normalerweise brauchen Sie beides. Beginnen Sie mit einem konsequenten Workflow. Definieren Sie ein Fortschrittsdelta und ein deterministisches Ergebnispredikat. Wiederholen Sie bekannte Arbeits , Warte , feststehende, unerreichbare und falsche Erfolgsfälle. Erst wenn die Klassifizierungen mit der Realität übereinstimmen, sollte ein Alarm oder eine begrenzte Wiederherstellungsaktionvon ihnen abhängen. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine öffentliche Website und das Artikel System sind live, aber die Produktion Agent Gesundheit Sammlung, Laufzeit Adapter und Wiederherstellung sind im Allgemeinen nicht versandt. Die Produktrichtung ist eine gesundheitliche Schicht, die Beweis , Frische , Vertrauens und Genehmigungsgrenzen leichter anwendbar macht, ohne die Laufzeit des Agenten zu ersetzen. Hauptbezüge OpenTelemetry: Semantische Konventionen für GenAI Agenten und Rahmenräume wurde am 24. Juli 2026 abgeholt; Dokumentstatus: Entwicklung. Claude Code: Überwachung offizielle Telemetriefelder und Konfiguration, abgeholt am 24. Juli 2026. Kubernetes: Lebhaftigkeit, Bereitschaft und Startup Sonden offizielle Untersuchungszwecke und Rückgewinnungsvorkehrungen, abgenommen am 24. Juli 2026.