2026-08-01T01:57:55.859Z
Datadog LLM Beobachtungsversuche: Fügen Sie ein Promotionsport hinzu
Fingerabdrücke im Vergleich, beweisen Sie die Zeilenbdeckung, bewahren Sie gültige Wartezeiten und blockieren Sie fehlende oder doppelte Effekte vor der Beförderung.
Datadog LLM Beobachtungsversuche können Ihnen sagen, dass eine Kandidaten Prompt , Modell , Anbieter oder Agentenarchitektur bessere Ergebnisse erzielte und schneller lief. Das ist nützlicher Beweis, aber es ist noch keine Freiheitsentscheidung. Die vernünftige Standardlage besteht darin, den Kandidaten und die Basislinie innerhalb des gleichen Datadog Projekts zu vergleichen, die Datensatzversion zu pinzen, die Definitionen des Evaluators stabil zu halten und die Verteilung und Spuren zu überprüfen, anstatt einem Durchschnitt zu vertrauen. Hinzufügen Sie dann ein kleines Werbeportal außerhalb der Scorecard: Beweisen Sie, dass jeder erforderliche Rekord ausgeführt wurde, erwartete Wartewarten Warte blieben, mutative Fälle produzierten genau einen Effekt und abgeschlossenen Fälle haben eine Bestimmungsbestätigung. In diesem Artikel wird dieser letzte Schritt mit einem achtfach aufgezeichneten Instrument umgesetzt. Der Kandidat verschiebt die Bewertungsrate von 75% auf 100% und die Durchschnittsdauer von 980 ms auf 738,75 ms . Die Beförderung ist blockiert. Eine Rückerstattung hat keine bestätigte Bestimmungsrechnung und eine Stornierung hat zwei Auswirkungen. Beweisen Sie zunächst, dass die beiden Experimente vergleichbar sind. Datadogs Überblick über die Experimente beschreibt drei Kernoperationen: Versiondatensätze, Experimente ausführen und Ergebnisse vergleichen. Das aktuelle Einrichtungsdokumentation definiert ein Experiment als eine Aufgabe, die sequentiell über Datensätze hinweg ausgeführt wird, mit Aufzeichnungsbewertern und optionalen Zusammenfassungsbewertern. Die Aufgabeninterne können dieselben Tracing Dekoratoren wie den Produktionscode verwenden. Diese primitiven geben Ihnen gutes Material für einen Vergleich. Sie entfernen nicht die Notwendigkeit, zu definieren, was zwischen den beiden Rennen identisch bleiben muss. Bevor Sie sich die Ergebnisse ansehen, schreiben Sie ein inhaltloses Manifest auf: Die Hashes identifizieren den Evaluiercode; sie sind keine Hashes von Anfragen, Ausgängen, Anmeldeinformationen oder Kundendaten. Hash die kanonische JSON Serialisierung dieses Manifests und füge den Fingerabdruck an beide Experimentarchive. Das Gerät erzeugt: Wenn sich die Fingerabdrücke unterscheiden, hört auf, das Ergebnis als ein Paarvergleich zu bezeichnen. Eine veränderte Datensatzversion kann schwierige Fälle hinzufügen. Eine veränderte Bewertungsperson kann die Schwelle verschieben. Ein fehlender Rekord kann den Durchschnitt verbessern, indem der wichtige Fehler beseitigt wird. Diese Änderungen können legitim sein, aber sie erfordern eine neue Basislinie. Datadogs Produktdurchgang sagt, dass Datensätze Versionsteuerung unterstützen und an bestimmte Versionen angeschlossen werden können. Es erklärt auch, dass die Vergleichsfläche Durchschnittswerte, Verteilungen, Latenz, Kosten, Tokenzahlen, Ausgänge und Spannungsspuren aufdeckt. Nutzen Sie das alles. Das Manifest ersetzt nicht die Beweise von Datadog; es verhindert versehentliches Vergleichsdrift, bevor Sie es interpretieren. Führen Sie ein Tor aus, das mit den Durchschnitten nicht übereinstimmen kann Das zu überprüfende Artefakt für diesen Artikel ist ein Standardbibliotheks Python Skript. Es enthält acht synthetische, inhaltsfreie Aufzeichnungen und emittiert JSON. Führen Sie es mit: Die Kernregel ist absichtlich klein: Das zweite Modell wird nicht gefragt, ob das erste Modell erfolgreich aussah. Es überprüft explizite Felder, deren Bedeutung Sie kontrollieren. Die vollständige Anlage erträgt: Messung Ausgangslinie Bewerber : : Vorhandene Aufzeichnungen 8/8 8/8 Überschreitungsschnitt der Bewertungsstelle 75% 100% Durchschnittliche Dauer 980 ms 738,75 ms Blockierung von Aufzeichnungen — 2 Beförderungsentscheidung — Block Die Entwicklerleitfaden für die Bewertung von Datadog unterstützt typisierte Evaluierungsergebnisse, eine optionale Pass /Fail Evaluierung, Metadaten, Tags und Zusammenfassungs Evaluierungen. Das macht einen Evaluier zu einer geeigneten Quelle für evaluatorPass . Sie macht nicht jeden Bewerter zu einem Bestimmungsprüfer. Vergleicht Ihr Bewertungsbeauftragter den erzeugten Text mit einer erwarteten Antwort, kann er übergeben werden, während eine Rückerstattung nie in das Hauptbuch gelangt. Halten Sie diese Beweisstraßen getrennt: EBewertungsstrecke: Hat die Ausgabe die gewählte Qualitätsregel erfüllt? ZTrace lane: Welche LLM, Abruf, Werkzeug und Aufgabenschritte wurden ausgeführt, und mit welchen Fehlern oder Latenzzeit? State lane: War der Fall funktionierend, rechtmäßig wartet, vollständig, unsicher oder benötigt eine Person? E Wirkungsstrecke: Ist die beabsichtigte externe Mutation genau einmal aufgetreten? O: Ist das Ziel jetzt das versprochene Ergebnis? Die ersten beiden Linien sind natürliche Eingänge von Datadog Experimenten. Die übrigen Strecken stammen von Ihrem Auftragsvertrag, Anlagen und Zielsystemen. Sie können ihre Ergebnisse als benutzerdefinierte Bewertungen oder Experimentmetadaten einreichen, aber sie definieren an der Grenze, die die Wahrheit besitzt. Die beiden blockierten Aufzeichnungen zeigen verschiedene Fehler. Die issue refund Aufzeichnung hat einen Pass Evaluator, einen complete Zustand und einen Versuchseffekt. Sein outcomeReceipt ist missing . Dies ist kein Beweis dafür, dass die Erstattung versagt hat; es ist ein Beweis dafür, dass die Fertigstellung nicht überprüft wurde. Das sichere Urteil ist uncertain , nicht grün und kein automatischer Neuerversuch. Die Aufzeichnung cancel subscription hat einen Pass Evaluator und eine verifizierte Bestimmungsbestätigung, aber effectCount ist zwei. Ein erfolgreicher Endzustand löscht den doppelten Effekt nicht aus. Der Kandidat wird blockiert, weil die Änderung die Sicherheit beeinträchtigt, auch wenn die Gesamtzahl verbessert wird. Die approval required Aufzeichnung zeigt die entgegengesetzte Grenze. Sein erwarteter Zustand ist waiting , und der Kandidat liefert einen Eigentümer, Deadline und Resume Token. Es geht vorbei. Eine Pause mit einer bekannten Abhängigkeit ist kein Stall, so dass ein Tor, das jede Zeile in complete beendet, das richtige Verhalten bestrafen würde. Diese Fälle sind absichtlich unangenehm. Wenn ein Werbeportal nur den Bewertungsscore wiederholt, kann er die Freigabeentscheidung nicht ändern. Ein nützliches Tor muss in der Lage sein zu sagen: der Vergleich ist ungültig, da sich die Berichterstattung geändert hat; der Kandidat ist hinsichtlich der Qualität besser, aber hinsichtlich der Wirkungen unsicher; der Bewerber ist schneller, hat aber ein unbekanntes Ergebnis hinterlassen; die Wartezeit ist gültig und darf nicht als Ausfall betrachtet werden; Die Beweise widersprechen sich, also muss man entscheiden. Fügen Sie das Tor zu einem echten Datadog Experiment an Der aktuelle Setup Guide von Datadog erfordert ddtrace =4.3.0 für den dokumentierten Python Experiments Pfad und erfordert sowohl einen API Schlüssel als auch einen Anwendungsschlüssel. Bewahren Sie diese Geheimnisse in Umgebungsvariablen; legen Sie sie nicht in ein Manifest, eine Datensatzzeile, ein Artikel Artefact oder ein Spurenattribut. Fügen Sie für einen vorhandenen Experiment Workflow das Gate in fünf beschränkten Schritten hinzu. 1. Einfrieren Sie den Vergleichsvertrag. Aufzeichnen Sie das Datadog Projekt, die Datensatzidentität und version, die angeordneten Aufzeichnungs IDs, die Evaluier Code Hashes, die Aufgabenrevision, die Kandidatenkonfiguration und den erwarteten Zustand für jeden Datensatz. Speichern Sie nur unsichtbare IDs oder Hashes, wenn der Inhalt empfindlich ist. 2. Vergleichen Sie die Abdeckung vor der Berechnung einer Rate. Vergleichen Sie erwartete Rekord IDs mit beobachteten Experiment Dokumenten. Fehlende, duplizierte oder unerwartete Ausweise sind nicht vergleichbar. Verringern Sie den Nenner nicht schweigend auf die wiederkehrenden Zeilen. 3. Ergeben Sie deterministische Felder an der Aufgabengrenze. Für eine nur zu lesende Aufgabe kann der Empfang eine schema gültige Antwort sein, die mit der erwarteten Quellrevision verbunden ist. Bei einer mutanten Aufgabe verwenden Sie einen Idempotency Schlüssel, eine Effektidentität und einen Zielseiten Such. Zählen Sie die verursachten Effekte, nicht erneute Versuche. 4. Bewahren Sie nicht Terminal Zustände. Ein Wartungsfall benötigt einen Grund, Besitzer, Frist und Identität. Ein Anmeldeverfahren kann korrekt als needs human beendet werden. Erstellen Sie keine Antwort, um eine Offline Score einfacher zu machen. 5. Befördern Sie nur in Verbindung. Der Kandidat kann befördert werden, wenn das Manifest übereinstimmt, die Abdeckung vollständig ist, die erforderlichen Bewertungsbeauftragten bestehen, die operativen Budgets halten, jeder Staat seinen Vertrag übereinstimmt, jedes abgeschlossenes Ergebnis verifiziert wird und jeder Mutationsfall hat genau eine beabsichtigte Wirkung. Ein gewogener Durchschnitt ist kein Ersatz, weil ein hoher Punktzahl einen einzigen katastrophalen Effekt mathematisch kompensieren kann. Eine praktische Politik ist: Tune Schwellenwerte für Beratungsqualitätsmetriken, Latenzzeit und Kosten. Vermisste Quittungen, duplizierte Effekte, geheime Expositionen und ungültige Vergleiche sollten als schwer fehlerhaft gehalten werden, es sei denn, Ihre Domain gibt eine sichere explizite Regel. Wissen Sie, was diese Prüfung nicht beweist Das System beweist seine eigenen acht Fälle und die Umsetzung der Regel. Es beweist nicht, dass Ihr Datensatz den Produktionsverkehr repräsentiert, die erwarteten Ausgänge korrekt sind, die Evaluier Hashes dem überprüften Code entsprechen oder die Zielkosten nicht gefälscht werden können. Es misst auch nicht die Produktqualität von Datadog und vergleicht keine Modelle. Diese Fragen erfordern die Überprüfung der Datensätze, die Quellkontrolle, die Zugriffskontrolle, die Produktionsprobenahme und die Vereinbarkeit mit dem realen Bestimmungsort. Datadog Experiments bleibt der Ort, um Experimentlauf, verteilung, spuren und bewertungsresultate zu studieren. Das Beförderungsportal ergänzt eine engere operative Entscheidung: ist dieser spezifische Vergleich vollständig und sicher genug, um die Änderung zu genehmigen? Die Produktrichtung von Sidewisp besteht darin, die Gesundheitsnachweise, die Unsicherheit und die Verifizierung des Wirkstoffs über die bestehenden Laufzeiten hinweg einfacher zu interpretieren. Es ersetzt nicht Datadog, Ihre Laufzeit oder Ihren Freisetzungsprozess. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Der öffentliche Standort und die interaktive Demonstration sind live; die Sammlung von Produktionsagent Gesundheit und die Datadog Integration werden im Allgemeinen nicht versandt.