2026-08-01T12:22:42.312Z
Grafana LLM Beobachtbarkeit: Beweisen Sie die Ergebnisschicht
Implementieren Sie die Generation von Grafana und OpenTelemetry-Pfaden, überprüfen Sie dann die Laufzeit, Wartezeit, Wirkung und Bestimmungsbeweise, bevor Sie einen Agenten gesund nennen.
Grafana LLM Beobachtbarkeit kann Ihnen einen starken Bericht über Modellanrufe, Agentengenerationen, Spuren, Werkzeugaktivität, Latenz, Token, Kosten und Bewertungen geben. Sie kann nicht alleine nachweisen, daß ein Vertreter bei Erwartung erreichbar war, auf die richtige Person wartete, exakt einmal eine äußere Wirkung angewandt hat oder das gewünschte Lieferprodukt erzeugt hat. Die praktische Standardlage besteht daher in zwei Teilen: Grafana für die Telemetrie verwenden, die sie dokumentiert, und dann einen kleinen Betriebsbeweisvertrag für die Fragen, auf die die Telemetrie nicht antwortet, hinzufügen. Testen Sie diese Teile separat. Ein Gespräch, das in Grafana erscheint, ist kein Beweis dafür, dass Spuren und Metriken angekommen sind, und ein sauberer Spuren ist kein Beweis dafür, dass sich das Ziel geändert hat. Dieser Leitfaden implementiert diese Grenze gegenüber der aktuellen Dokumentation von Grafana und dem JavaScript Paket @grafana/agento11y . Sie beinhaltet auch einen siebenfachen Audit, der die Akzeptanzregel umsetzbar macht, anstatt sie als Dashboard Ratschläge zu überlassen. Beginnen Sie mit dem dokumentierten Pfad, dann testen Sie es in Stücke Grafana stellt derzeit zwei verwandte Routen auf. Sein allgemeiner AI Beobachtbarkeits Einstellung sendet Standardmäßig OpenTelemetry Spuren, Metriken und Logs durch das Grafana Cloud OTLP Gateway; ein OpenTelemetry Collector oder Grafana Alloy ist die dokumentierte Alternative, wenn Sie Routing, Transformation oder eine bessere Steuerung bei höherem Volumen benötigen. Seine neuere Beobachtbarkeit des Agenten Oberfläche fügt agentorientierte Generationen, Gespräche, Tool Anrufe, Workflow Schritte, Token und Kostendaten, Evaluationen und Framework Integrationen hinzu. Für JavaScript ist das aktuelle Paket @grafana/agento11y . Das npm latest Tag lieferte am 27. Juli 2026 die Version 0.9.0 zurück. Behandeln Sie das als einen datierten Implementierungs Snapshot, nicht als eine dauerhafte Versionempfehlung. Der kürzeste dokumentierte Start sieht so aus: Dann konfigurieren Sie das SDK anhand von Umgebungsvariablen, anstatt ein Access Token in die Quelle zu setzen: Die entsprechenden Umgebungsvariablen werden als AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID und AGENTO11Y AUTH TOKEN dokumentiert. Drucken Sie ihre Werte nicht in Logs oder fügen Sie sie an Spuren an. In Grafanas JavaScript Instrumentationsleitfaden gibt es eine Grenze, die leicht vermisst werden kann: Generationsexport und OpenTelemetry Export sind nicht derselbe Weg. Das SDK kann Generationsdaten senden, benötigt aber eine anwendungskonfigurierte TracerProvider und MeterProvider , um die von ihm emittierten Spans und Metriken zu exportieren. Ohne diese Anbieter sind die Spuren und Metriken schweigend verloren. Das macht ein sichtbares Gespräch zu einem schwachen Setup Test. Verwenden Sie stattdessen drei unabhängige Sonden: 1. Erstellen Sie eine Generation mit einer einzigartigen Test ID und finden Sie sie in Conversations . 2. Finden Sie eine Spanne mit derselben Korrelations ID in der Datenquelle von Spuren. 3. Über das Testfenster eine von SDK ausgestellte Metrik abfragen und ihre Ressourcenattribute bestätigen, um den erwarteten Service und die erwartete Umgebung zu identifizieren. Es fehlt eine Sonde. Vergessen Sie die drei nicht in eine beruhigende Punktzahl: generation=yes, trace=no, metric=no ist eine teilweise Telemetrie, keine meist gesunde Installation. Eine vollständige Grafana Spur ist immer noch Beweis für Aktivitäten. Grafana dokumentiert nützliche Berichterstattung. Agent Observability kann Generationen, Tool Anrufe, Workflow Schritte, Latenz, Fehler, Token, Kosten, Qualitätsscores und Versionsvergleiche erfassen. Diese Signale können Fragen wie beispielsweise beantworten: Hat der LLM Anruf versagt oder verlangsamt? Welche Modell und Agentenversion hat die Flucht behandelt? Welche Werkzeuge wurden eingesetzt, und auf welchen Spuren? Wie viele Token und wie viel Kosten verbrauchte der Run? Hat eine konfigurierte Bewertung oder eine Wachstelle einen Punkt erzielt? Die OpenTelemetry GenAI Agentenkonventionen geben dieser Aktivität ein tragbares Vokabular. Zu der Zeit der Forschung wurden die Agentenkonventionen explizit auf den Entwicklungsstatus gekennzeichnet und umfassten Operationen zur Anrufung eines Agenten oder eines Workflows, zur Planung und zum Ausführen eines Werkzeugs. Entwicklungsstatus ist wichtig: Steck die Instrumentationsversion an und erwarte, dass sich Attribute oder Spannungsformen entwickeln. Keiner dieser Spannungsnamen definiert Ihr Geschäftsergebnis. Eine execute tool Span kann eine erfolgreiche HTTP Antwort melden, während der Anbieter die Anfrage asynchron anwendet, sie nach der Validierung ablehnt oder an das falsche Objekt schreibt. Eine vollendete Workflow Zeit kann mit einer fehlenden Datei koexistieren. Eine Qualitätsbewertung kann den generierten Text scoren, während ein geplanter Lauf nie gestartet wurde. Verwenden Sie eine Beweiskarte, die sowohl den Beweis als auch seine Grenze angibt: Beweisflugzeug Es kann feststellen, Es stellt nicht fest, Freisetzungssonde Erzeugungsexport Eine aufgezeichnete Modellgeneration erreichte Agent Observability Spuren und Metriken wurden exportiert Finden Sie eine einzigartige Gesprächs ID Spuren Instrumentierte Operationen und ihr Ursachenweg Der externe Bestimmungsort hat nun den beabsichtigten Zustand Frag die korrelierte Spanne Metriken Aggregate Rate, Dauer, Fehler, Token und Kostensignale Erfolgreich ein erforderlicher Auslauf oder Lieferwert Frag das genaue Testfenster Auswertung Ein Namensschützer lief gegen die Lieferung von Material Eine deterministische Bestimmungsanspruchsanspruchsvergabe Erhalt der Scorer Version und der Eingabebereich Fahrzeitrechnung Die Laufzeit war zu einem erwarteten Zeitpunkt erreichbar und frisch Die Aufgabe ist abgeschlossen. Vergleichen Sie das Herzschlagalter mit seinem SLA Warten Sie auf die Quittung Eine Pause hat einen Grund, Eigentümer, Frist und Weiterlauf Der Besitzer wird rechtzeitig entscheiden . Überprüfen Sie Routing und Eskalation Wirkungsbewilligung Eine externe Operation kann vereinheitlicht werden. Das vollständige Ergebnis des Benutzers ist vorhanden Rücklesen durch stabilen Betriebs ID Ergebnisrechnung Eine Bestimmungsortbezogene Behauptung verabschiedet Zukunftsstabilität Nachprüfen während eines Stabilitätsfensters Das ist kein Argument für mehr Inhalte. Identifikatoren, Zeitstempeln, Versionen, Niedrigkardinalzustände, Hashes, Zählungen und Bestimmungsansprüche bevorzugen Roh Anforderungen, Fertigstellungen, Tool Nutzkosten, Geheimnisse oder Dateiwege. Richte Telemetrie und Datenminimierung sind kompatibel, wenn der Vertrag vor der Instrumentierung entworfen wird. Durchführung der Abdeckungsprüfung in sieben Fällen Ich habe die Karte in ein kleines deterministisches Instrument umgewandelt. In jedem Fall wird aufgezeichnet, ob die Erzeugung, die Spur und die metrische Ausfuhr erfolgreich waren; ob die Telemetrie und der Laufzeit Herzschlag frisch sind; ob der Lauf eine rechtmäßige Wartezeit hat; ob eine externe Wirkung vereinbart wurde; und ob das erwartete Ergebnis einen autorisierten Empfang hat. Der Klassifizierer hat eher Vorrang als Arithmetik: Die sieben Anlagen decken: keine Generation kam; die Generation kam, aber Spannungen und Metriken nicht; alle Telemetrie existiert, ist aber veraltet; der Agent wartet legitim mit einem Eigentümer, Frist und Wiederaufnahme Token; ein Werkzeugversuch hat keinen Eintritt in eine Vereinbarung; die Telemetrie und die Werkzeugnachweise sind grün, aber das Lieferwert fehlt; derselbe ausgefüllte Fall eine zugelassenen Lieferbewilligung hat. Die lokale Wiedergabe hat alle sieben erwarteten Klassifikationen bestanden: Der nützlichste Vergleich ist zwischen den beiden letzten Fällen. Beide haben Generation, Spuren und Metrik Export. Beide sind frisch. Beide Berichte über den abgeschlossenen Betrieb und die Überprüfung der Werkzeugwirkung. Der erste hat keine Bestimmungsbestätigung und wird false success klassifiziert; der zweite fügt object:report 17 plus einen Content Hash hinzu und wird verified . Dieser Wandel ist absichtlich eng. Kein Dashboard Panel, keine Anzahl von Token, keine Modell Score oder Trace Statusänderungen. Nur die nach dem Antrag des Benutzers erforderlichen Beweise ändern sich. Die Prüfung hat eine schwierige Begrenzung: sie vertraut den ihm vorgelegten Fakten. Ein bösartiger oder gebrochener Sammler kann lügen, und eine Quittung aus dem falschen Ziel ist kein Beweis. In der Produktion erzeugen Sie Ergebnisse bei der autoritativen Grenzeeine Speicherlesung nach dem Schreiben, eine Datenbankbeschränkungsfrage, eine Bereitstellungsgesundheitssonde, eine Suche nach Send Message Anbieter oder eine andere deterministische Behauptung, die mit der ursprünglichen Arbeits ID verbunden ist. Verwandeln Sie die Abdeckung in ein Produktions Akzeptanz Tor Führen Sie einen instrumentalisierten Canary aus, bevor Sie eine neue Agentversion, eine Rahmenintegration, eine Sammlerroute oder eine Änderung der Probenahme aktivieren. Geben Sie dem Kanarien eine einzigartige Arbeits ID und ein harmloses erwartetes Ergebnis. Dann müssen alle geltenden Behauptungen vorgelegt werden: Generation: die Generation existiert unter der Kanarien ID. Trace: die Wurzelspannung und die erforderlichen Kinderoperationen sind abfragbar. Metric: das Kanarienfenster trägt zur erwarteten Serie bei. Frische: Verzögerung des Sammlers bleibt unter einer angegebenen Grenze. Runtime: ein Herzschlag oder ein Scheduler Receipt beweist, dass die Laufzeit bei der Erwartung erreichbar war. Wartung: jede Pause nennt ihren Grund, autorisierten Besitzer, Entscheidungstermine, Eskalationsroute und Wiederholungshandle. Effekt: Nebenwirkungen entsprechen einer stabilen Idempotenz oder einem Operations ID des Anbieters. OAusgang: eine autorisierte Bestimmungsprüfung beweist, dass das gewünschte Artefakt oder der angeforderte Zustand existiert. Privatsphäre: die Testfrage bestätigt, dass verbotene prompt , response , secret und path Felder fehlen. Halten Sie die Urteile unbequem. telemetry partial sollte eine Ausführung von Instrumenten blockieren. health unknown sollte einen grünen Status verhindern, wenn die Beweise veraltet sind. waiting sollte den Eigentümer darüber informieren, ohne die legitimen Arbeiten wieder aufzunehmen. uncertain effect sollte Blind Wiederversuche stoppen. false success sollte die Aufgabe oder den Vorfall auch dann wieder öffnen, wenn die Spur normalerweise beendet ist. Die Probenahme muss getrennt entschieden werden. Schwere Spuren können bei Volumenproben entnommen werden, aber die kompakten Gesundheitsbestätigungen, die für die Einstufung eines erforderlichen Laufs erforderlich sind, sollten nicht mit ihnen verschwinden. Beibehalten Sie genügend Identifikatoren, um geprobte Spuren mit nicht geprobten Lauf , Warte , Effekt und Ergebnisrechnungen zu korrelieren. Ansonsten wird eine günstigere Telemetriepolitik leise zu einer schwächen Korrektheitspolitik. Es gibt auch Betriebskosten. Bestimmungsrücklesungen erhöhen Latenz und Anbieteranrufe; Laufzeit Herzschläge erhöhen Speicher und Frische Checks; Warte Receits benötigen Routing Eigentum. Verwenden Sie die kleinste deterministische Prüfung, die die Entscheidung löst. Eine Datei Existenz und Hash Check ist besser als ein anderes Modell zu fragen, ob die Datei wahrscheinlich existiert. Ein LLM Rechter bleibt nützlich, wenn das Ergebnis semantisch ist, erfasst aber neben deterministischen Kontrollen seine Version, Rubrik, Eingabebereich und Unsicherheit. In welchem Sidewisp passt Grafana ist ein geeigneter Ort, um Telemetrie zu überprüfen und zu korrelieren. Die hier beschriebene fehlende Schicht ist das operative Urteil über Erreichbarkeit, Fortschritt, Wartezeit, Effekte und Ergebnissenicht ein weiterer Spurenschauer. Sidewisp soll eine gesundheitliche Schicht um die bestehenden Wirkstofflaufzeiten mit ausdrücklichen Beweisen, Frische, Unsicherheit, Genehmigungsgrenzen und Überprüfung werden. Es handelt sich nicht um eine Ersatzlaufzeit oder ein obligatorisches Modell Gateway. Die Produktionsüberwachungs und Wiederherstellungsadapter werden heute nicht versandt. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Wenn diese Beweisgrenze übereinstimmt, wie Sie Agenten bedienen, ist der passende nächste Schritt, sich der privaten Vorschau Warteliste anzuschließen und die erforderlichen Laufzeit und Ergebniskontrollen zu beschreiben. Bis dahin halten Sie Grafana's Telemetrie Urteile genau und fügen Sie den Abschluss an den Bestimmungsort mit den Beweisen, die Ihre Arbeit tatsächlich benötigt.