2026-07-31T20:58:30.340Z
Splunk LLM Beobachtbarkeit: Halten Sie die Bewertungsrufe aus der Agentengesundheit
Audit Splunk Evaluator Isolation, histogramm Telemetrie, Probenahme Abdeckung, Kardinalität, Inhaltsufnahme und Ergebnisnachweis, bevor Sie einer grünen Agent-Ansicht vertrauen.
Die Beobachtbarkeit von Splunk LLM kann nützliche Leistungen, Qualität, Token, geschätzte Kosten und Spurennachweise für einen instrumentalisierten Agenten zeigen. Die sichere Betriebsvorgabe ist jedoch nicht die Seite AI Agents ist bewohnt, daher ist der Agent gesund. Beweisen Sie zunächst, dass die Messpipeline vollständig ist, dass die Anrufe des Bewerters nicht als Anwendungsarbeit gezählt werden, dass die Bewertungsdeckung einen bekannten Nenner hat und dass das gewünschte Ergebnis außerhalb der Spur existiert. Dieser Leitfaden baut diesen Beweis auf, ohne Anregungen oder Antworten zu sammeln. Die eingeschlossenen acht Fälle erzeugen einen inhaltlosen Empfang und die Routen führen jeweils zu einem dieser Zustände: Unvollständige Einnahme, Unvereinbarkeit mit den Metriken des Vertrages, selbst beobachtete Bewertung, ein hohes Kardinalrisiko, Überprüfung der Inhaltspolitik, abgenommener Abdeckung der Bewertung, beobachtbar, aber nicht überprüft, oder gesund mit abgedeckten und verifizierten Beweisen. Überprüfen Sie den Messweg, bevor Sie den Score lesen Die aktuelle Einrichtungsdokumentation von Splunk macht zwei Telemetrie Details operationell wichtig. Zunächst sind histogrammmetriken für die AI Agent Monitoring Seiten erforderlich. Wenn der SignalFx Exporteur verwendet wird, ist die dokumentierte Einstellung des Sammlers send otlp histograms: true . Die Einstellung legt auch die Delta Temporalität durch: Eine sichtbare Spur beweist nicht, dass dieser metrische Weg korrekt ist: Spannungen und Histogramme können unabhängig ausfallen. Zweitens kann die Python AI Instrumentation Evaluierungen im gleichen Prozess wie die Anwendung ausführen. Splunk dokumentiert diesen Schalter, dessen Standard falsch ist: In diesem Standardmodus können LLM Anrufe von Evaluatoren wie DeepEval neben Anwendungsanrufen instrumentalisiert werden. Die Einstellung der Evaluierungen auf True Runs in einem Kindprozess mit deaktiviertem OpenTelemetry SDK verhindert, dass die Anrufe der Evaluierenden die Applikationstelemetrie verschmutzen. Splunk markiert diese Isolation, wie sie für OpenAI Instrumente erforderlich ist, wenn die Bewertungen aktiviert sind und für andere dokumentierte Rahmenbedingungen optional sind. Diese Unterscheidung verändert die Bedeutung eines Diagramms. Nehmen wir an, dass ein Agent zwei Mal ein Modell anruft, und dann macht ein Evaluier noch drei Modellanrufe. Wenn der Evaluator den instrumentalisierten Prozess teilt, kann eine naive Aggregate fünf Anrufe, ihre kombinierten Token und ihre kombinierte Latenz melden. Die zusätzliche Aktivität ist echt berechnet, aber es ist kein Beweis dafür, dass der Agent mehr Fortschritte gemacht hat. Es handelt sich um Messarbeit, die Messarbeit beobachtet. Erfassen Sie einen inhaltlosen Quittungsantrag pro Bereitstellung: Keines dieser Felder benötigt einen Anruf, eine Antwort, ein Werkzeugargument, ein Geheimnis oder einen Kunden Identifikator. Sie beschreiben die Gesundheit der Beweisleitung. Die ersten drei Prüfungen beantworten verschiedene Fragen: histogramsExported : Hat der Sammler die histogramm Telemetrie exportiert, die von den AI Überwachungsseiten verlangt wird? deltaTemporality : Passt der Metrikvertrag zur dokumentierten Konfiguration? aiSpanVisible : Hat mindestens eine neue GenAI Span die erwartete Splunk Ansicht erreicht? Zusammenbrechen Sie diese nicht in eine telemetry ok Boolean. Wenn die Spannungen ankommen, aber die Histogramme nicht, kann die Spurenuntersuchung funktionieren, während die Aggregate Panels unvollständig bleiben. Wenn die Daten alt sind, kann eine besiedelte Seite immer noch veraltet sein. Behalten Sie die Beweisquelle und die Beobachtungszeit neben dem Empfang in einer echten Umsetzung. Geben Sie jedem Qualitätsscore einen Deckungsdenominator Splunk beschreibt einen AI Agentqualitätsscore als den Prozentsatz der Bewertungen, die für eine Metrik bestanden haben. Die AI Agents Dokumentation besagt, dass die Spannungen für die Berechnung dieser Punkte geprüft werden, und eine Punktzahl unter 80% zeigt ein Qualitätsproblem. Das kann eine nützliche Regel für die bewertete Stichprobe sein. Es ist nicht an sich der Beweis dafür, dass jede berechtigte Aufforderung bewertet wurde oder dass die Stichprobe jeden Aufgabentyp repräsentiert. Verfolgen Sie vier Zahlen zusammen: 1. berechtigte Bewerbungszeiten; 2. konfigurierte Bewertungsprobenrate; 3. abgeschlossenen Bewertungsergebnissen; 4. Die Bewertungsabfolge sinkt. Für ein deterministisches Prüffenster berechnen Sie: Bei 400 berechtigten Spannungen, einer Stichprobenquote von 0,25, 100 Bewertungen und Null Tropfen beträgt die beobachtete Abdeckung 25% und entspricht der konfigurierten Erwartung. Das bedeutet, dass Znot die übrigen 300 Spannungen vergangen sind. Das bedeutet, dass der Auswertungszustand außerhalb der Probe liegt. Die Python Konfiguration von Splunk zeigt auch eine Auswertungszeilegröße auf. Ein positives Bind gilt als Rückdruck; wenn die Warteschlange voll ist, werden neue Gegenstände mit einer Warnung fallen gelassen. Die Dokumentation empfiehlt eine Grenze im Bereich 1001000 abhängig von Durchsatz und Speicher, während Null oder Unset die Warteschlange unbegrenzt lässt. Jede Wahl hat einen Kompromiss: eine unbegrenzte Warteschlange kann die Auswertungsverzögerung in Speicherdruck verwandeln; eine begrenzte Warteschlange kann den Prozess aufrechterhalten, aber die Abdeckung der Bewertung reduziert; Ein Reihen Drop Zähler von sechs bedeutet, dass 94 abgeschlossenen Bewertungen nicht ehrlich für 100 zulässige Bewertungen zu einer Stichprobenquote von 100% stehen können. Die Prüfung stellt daher EVALUATION COVERAGE DROPPED , nicht gesund und nicht gescheiterter Agent, zurück. Der Agenten hat vielleicht nützliche Arbeiten erledigt; die für das Qualitätsurteil erforderlichen Beweise sind unvollständig. Metrische Dimensionen benötigen eine ähnliche Grenze. Splunk erlaubt es GenAI Kontextattribute in metrische Dimensionen zu kopieren, warnt jedoch explizit, dass gen ai.conversation.id zu hohen Kardinalitätsproblemen führen kann. Bewahren Sie die Identität des Gesprächs auf Spans, wenn sie zur Diagnose erforderlich ist. Verwandeln Sie sie nicht automatisch in eine metrische Dimension. Eine Umgebung mit niedriger Kardinalisierung oder eine Mieterstufe ist für die Aggregation in der Regel sicherer; die richtige Menge hängt immer noch von Verkehrs und Mietergrenzen ab. Halten Sie Inhalte festhalten eine explizite Ausnahme In der LLM Dienstdokumentation von Splunk heißt es, dass die Erhebung von Anfragen und Antworten standardmäßig ausgeschaltet ist und warnt, dass der Inhalt sensible oder persönlich identifizierbare Informationen enthalten kann. Der Einrichtungspfad weist auch darauf hin, dass große erfasste Eingänge und Ausgänge die Backend Grenzen überschreiten und Leistungsprobleme verursachen können. Diese Prüfung braucht keinen Inhalt. Es kann den Export von Histogrammen, die Temporalität, die Prozessisolation, die Probenahme, die Tropfen, die Dimensionen, die Sichtbarkeit von Spuren und einen Zielkredit allein mit Metadaten überprüfen. Wenn eine getrennte Qualitätsuntersuchung wirklich erfasste Inhalte erfordert, führen Sie sie durch eine Inhalts und Richtlinienüberprüfung: die genaue Bewertungsperson, die den Inhalt benötigt, zu identifizieren; die Feststellung, ob die Festnahme auf Spannungen, Ereignissen oder beidem stattfindet; Aufbewahrung, Zugriff, Verhüllung und Löschung von Dokumenten; Testverhalten in der Nutzlastgröße; Überprüfen, dass die Definitionen des Werkzeugs nicht nur deshalb erfasst werden, weil die Nachrichtenaufnahme aktiviert wurde; die Einnahme nach der begrenzten Untersuchung zu deaktivieren, wenn eine kontinuierliche Einholung nicht gerechtfertigt ist. Das Gerät gibt CONTENT POLICY REVIEW zurück, wenn die Erfassung ohne Genehmigungsbestätigung aktiviert ist. Dieses Urteil ist bewusst weder gesund noch gebrochen. Es heißt, die Instrumente haben eine Datengrenze überschritten, die die Gesundheitsprüfung nicht genehmigen kann. Die gleiche Einschränkung gilt für die geschätzten Kosten. Splunk stellt fest, dass seine Agentenkostenschätzung die veröffentlichten Anbieterkosten mit den verfügbaren Tokenzahlen multipliziert und keine tatsächliche Abrechnung darstellt. Kennzeichnen Sie die geschätzten Daten, behalten Sie das Preisdatum und bringen Sie sie nicht schweigend mit einer Rechnung oder einem spezifischen Cache Rabatt für den Anbieter in Einklang. Durchführung der Prüfung der Beweise in acht Fällen Das reproduzierbare Artefakt verwendet eine Vorrangsregel. Frühere Erkenntnisse blockieren spätere grüne Zustände: Führen Sie die gespeicherte Einstellung aus: Es erläutert acht Fälle und liefert acht verschiedene Ergebnisse: Dabgedeckt und verifiziert HEALTHY COVERED VERIFIED : Erforderliche Telemetrie, angegebene Stichprobe, Nulltröpfungen und Ergebnisvereinbarung. Evaluator selbst beobachtet EVALUATOR SELF OBSERVED : Richteranrufe können die Anwendungstelemetrie eingeben. histogramme fehlen INGESTION INCOMPLETE : Eine Spur beweist nicht, dass die erforderlichen Kennzahlen eingetroffen sind. X Fehlerzeit METRIC CONTRACT MISMATCH : Der ausgeführte Metrikvertrag unterscheidet sich von der dokumentierten Einrichtung. Konversation id as metric HIGH CARDINALITY RISK : Per Konversation Identität wurde in eine metrische Dimension gefördert. Inhalte erfassen nicht überprüft CONTENT POLICY REVIEW : Eine Grenze für sensible Daten wurde ohne Quittung überschritten. Evaluation Queen dropped EVALUATION COVERAGE DROPPED : 94 Ergebnisse können keine erwarteten 100. Ztrace without outcome OBSERVABLE NOT VERIFIED : Exekutionsnachweise existieren, aber das versprochene Ergebnis nicht. Das ist eine synthetische Konfigurationsprüfung, nicht ein Live Splunk Konformitätstest. Es kann nicht beweisen, dass ein Sammler erreichbar ist, dass eine Rolle die erforderliche Fähigkeit umfasst, dass die Aufbewahrung ein Vorfallfenster abdeckt oder dass ein Ziel das erwartete Lieferwert enthält. Ersetzen Sie die Feststellungswerte durch Beobachtungen aus Ihrer Umgebung und behalten Sie unknown bei Nichtmessung eines Wertes. Halten Sie die Spur vor dem Urteil. Die Spur von Splunk und AI Interaktionsansichten beantworten wichtige Fragen zu Modelloperationen, Fehlern, Token Nutzung, Latenz und ausgewerteter Antwortqualität. Ein Urteil über die Gesundheit eines Agenten hat noch eine Grenze: Ist die angeforderte Arbeit erfolgt? Wählen Sie die stärkste verfügbare deterministische Bestimmungsprüfung aus: eine Datei befindet sich auf dem erwarteten Pfad und entspricht einem Schema oder Hash; Es besteht ein Pull Anforderung im erwarteten Repository und eine Verpflichtung; eine Nachricht am beabsichtigten Bestimmungsort mit dem erwarteten Idempotency Schlüssel vorhanden ist; eine Datenbankmutation ist unter der beabsichtigten Mieter und Betriebs ID sichtbar; eine Prüfstelle, die gegen das hergestellte Artefakt abgelegt wurde; Eine menschliche Genehmigung ist noch in Auswahl, also ist der Lauf waiting , nicht gescheitert. Verbinden Sie die Quittung mit einer privaten Identifikationsmarke. Halten Sie die zu lieferenden Inhalte an ihrer Quelle. Eine erfolgreiche Spanne plus eine fehlende Quittung ist OBSERVABLE NOT VERIFIED ; es ist keine automatische Erlaubnis, erneut zu versuchen, da der externe Effekt möglicherweise vorhanden ist, aber vorübergehend nicht lesbar ist. Die praktische Regel ist einfach: Vertrauen Sie der Splunk Ansicht, nachdem ihr eigener Messweg vorbei ist, interpretieren Sie die Qualitätsscore innerhalb ihrer bekannten Abdeckung und legen Sie die Gesundheit des Agenten nur klar, wenn das beabsichtigte Ergebnis separat überprüft wird. Sidewisp folgt derselben Beweis First Produkt Richtlinie: Aktivität von nützlichen Fortschritten zu unterscheiden, fehlende Beweise aufzudecken und die Ergebnisüberprüfung getrennt von der Vervollständigung von Spuren zu halten. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine Produktionsüberwachungsadapter und die Wiederherstellungsmotor werden hier nicht als allgemein verfügbar dargestellt; der öffentliche Standort ist ein Erlebnis für den frühen Zugang und eine Produktdemonstration. Quellen Einrichtung von AI Agentüberwachung, Splunk Observability Cloud Dokumentation. Konfigurieren Sie den Python Agent für AI Anwendungen 0.1.14 und höher, Splunk Observability Cloud Dokumentation. Überwachung von AI Agenten, zuletzt am 16. Juni 2026 aktualisiert. Überwachung der LLM Dienste, zuletzt aktualisiert am 12. Mai 2026.