2026-08-01T09:31:00.167Z

MLflow LLM Bewertung: Hinzufügen eines Laufzeit-Gesundheit-Release-Gates

Reproduzieren Sie den Bewertungspfad von MLflow und fügen Sie dann vier Runtime-Receits hinzu, damit ein passender Punkt nicht zu einem falsch-grünen Agentenurteil wird.

Die MLflow LLM Bewertung kann Ihnen sagen, ob die Ergebnisse einer Anwendung den von Ihnen gewählten Kriterien entsprechen. Sie kann nicht alleine nachweisen, daß der Agent erreichbar war, rechtzeitig eingeleitet wurde, eine äußere Nebenwirkung vollendet hat oder das versprochene Lieferprodukt an seinem Bestimmungsort zurückgelassen hat. Die praktische Standardlage besteht darin, das Ergebnis der MLflow Evaluierung und das Urteil über die Laufzeit Gesundheit als zwei Beweislagen zu behalten, und dann beides vor der Veröffentlichung zu verlangen. Ich habe diese Grenze mit MLflow 3.14.0 getestet. Ein Code basierter Scorer gab drei Agenten einen perfekten exact deliverable/mean von 1.0 . Eine gesonderte Gesundheitsregel mit vier Zuschüssen erlaubte nur einen dieser Rennen. Der Unterschied war kein Fehler im MLflow. Es war ein Ungleichgewicht zwischen der Frage, auf die der Schütze antwortete, und der breiteren operativen Entscheidung. Vervielfältigen Sie den dokumentierten MLflow Evaluierungspfad Der aktuelle Bewertungsanleitung von MLflow definiert eine Auswertung aus drei Komponenten: einem Datensatz, einem oder mehreren Scorer und einer optionale Vorhersagefunktion. Der Datensatz liefert Inputs und Erwartungen. Eine Vorhersagefunktion erzeugt Ausgänge, wenn sie nicht bereits vorhanden sind. Scorer verwandeln die verfügbaren Beweise in Feedback oder Metriken. Diese Teilung ist nützlich, weil sie die Bewertungsfrage explizit macht. Wenn die Frage Wurde diese Ausgabe dem erwarteten lieferbaren Namen gleich?, ist ein deterministischer Code basierter Scorer geeigneter als ein LLM Suzender. MLflows angepasste Scorer Dokumentation ermöglicht es den Torschützen, inputs , outputs , expectations oder eine vollständige Spur zu lesen und ein primitives Ergebnis oder reicheres Feedback zurückzugeben. Das Experiment verwendete eine Inline Liste, vorgenerierte Ausgänge und diesen Scorer: MLflow hat exact deliverable/mean = 1.0 registriert. Das ist das korrekte Ergebnis für die definierten Beweise: Jede Ausgangsstränge entsprach ihren Erwartungen. Das Ergebnis ist reproduzierbar, billig und leicht zu erklären. Es ist auch schmaler als Alle drei Agenten sind gesund. MLflows Dokumentation des Datensatzes für die Bewertung beschreibt Datensätze als ausgewählte Beispiele für Regressionsprävention, Versionsvergleich und gezielte Qualitätsprüfungen. Das ist das richtige Denkmodell. Ein Datensatz ist eine Test Suite für die in seinen Beispielen und Scorer codierten Ansprüche; es ist nicht automatisch eine Volkszählung jedes Produktionsversagens, die zählt. Stellen Sie die Betriebsergebnisse neben dem Bewertungsergebnis Das gleiche Gerät beigefügt eine kleine Laufzeit Rechnung zu jeder Aufgabe. Es ergab vier Fakten, die der Exakt Output Scorer nicht überprüfte: heartbeatFresh : die Laufzeit ist kürzlich erreichbar; scheduleOnTime : der erwartete Lauf begann innerhalb seines zulässigen Fensters; effectVerified : der externe Bestimmungsort bestätigt die beabsichtigte Nebenwirkung; deliverableVerified : Das versprochene Artefakt existiert und überläuft die Bestimmungsprüfung. Der daraus resultierende Vergleich war: Aufgabe Genau lieferbar Beweise für die Laufzeit Freigabebeschluss run 101 Pass Alle vier Einnahmen vorhanden Freisetzung run 102 Pass Verfallener Herzschlag; Wirkung und Lieferwert unüberprüft Block als unerreichbar run 103 Pass Zeitplan verpasst sein zulässiges Fenster Block so spät wie möglich. Alle drei Evaluierungszeilen sind bestanden. Nur eine Runde war freigelassen. Eine richtige String kann in einer Cache Antwort überleben, nachdem ein Arbeiter verschwunden ist. Eine richtige Nutzlast kann nach der Geschäftsfrist ankommen. Ein Tool Anruf kann eine plausible Anerkennung zurückgeben, während das Ziel unverändert bleibt. Keiner dieser Fälle macht den Ausgangswertwert ungültig; sie zeigen, warum die Freigabeentscheidung zusätzliche Beweise benötigt. Halten Sie die Schichten durch einen stabilen task id oder run id verbunden, aber lassen Sie sie nicht in eine vage Punktzahl zusammenbrechen. Eine Kompaktplatte kann so aussehen: Die Verbindung ist wichtig. Ohne sie kann ein Team eine aktuelle Krankenkarte mit einer Auswertung aus einer anderen Version, einer anderen Umgebung oder einem erneuten Versuch vergleichen. Fügen Sie die Anwendungsversion, die Datensatzversion, die Scorer Version, die Umgebung und die Beobachtungszeit ein, wenn diese Dimensionen das Urteil ändern können. MLflow kann die Beurteilung und die Nachverfolgung von Beweisen behalten; die Laufzeit oder das Ziel müssen immer noch Fakten liefern, die nur ihm bekannt sind. Die fehlenden Beweise werden als unknown und nicht als pass behandelt. Ein fehlender Herzschlag kann eher ein Sammlerversagen als ein Agentenversagen bedeuten. Eine fehlende Bestimmungsbestätigung kann bedeuten, dass die Aufschrift fehlgeschlagen ist, dass der Prüfer fehlgeschlagen ist oder dass die Integration die Tatsache nicht aufdecken kann. Diese Staaten fordern eine Untersuchung; sie rechtfertigen keine grüne Freigabe. Verwenden Sie eine Entscheidung mit zwei Toren anstelle einer gemischten Punktzahl Eine praktische Freigaberegel ist bewusst langweilig: Jede Klausel sollte ihre eigenen Beweise, Frische und fehlerhafte Gründe behalten. Das gibt einem Betreiber eine begrenzte nächste Aktion: Ein Ausfall der Bewertung führt zurück zum Anruf, Modell, Tool Politik, Datensatz oder Scorer. Ein veralteter Herzschlag führt zur Laufzeit oder Sammlerdiagnose. Eine verpasste Fahrplanroute zum Planer, der Warteschlange oder der Kapazitätsgrenze. Eine unbestätigte Wirkung blockiert erneute Versuche, bis der externe Bestimmungsort abgestimmt ist. Eine fehlende Lieferroute zum Hersteller oder Bestimmungsprüfer. Diese Trennung verhindert auch, dass ein LLM Richter eine Behörde wird, für die er nicht vorgesehen war. Richter sind wertvoll, wenn Richtigkeit oder Qualität eine semantische Bewertung erfordert. MLflow unterstützt explizit integrierte, anhand von Richtlinien, benutzerdefinierte und codebasierte Scorer. Verwenden Sie diese Werkzeuge für ihre angegebenen Kriterien. Vorzugsweise deterministische Bestimmungsprüfungen für Datei Existenz, Datenbankzustand, API Ressourcen, Testergebnisse oder signierte Quittungen. Lesen Sie das Experiment nicht, da MLflow keine Produktionsüberwachung hat. MLflow Dokumentenbewertung, Spuren, Überwachung, Datensätze, Feedback und mehrere Scorer Typen. Die schmalere Schlussfolgerung ist falsch: Die hier durchgeführte genaue Bewertung konnte vier operative Fakten nicht feststellen, weil ihre Daten und Scorer sie nicht getestet haben. Sie können gesundheitsorientierte Scorer hinzufügen, wenn die relevanten Beweise vorhanden sind, oder den Gesundheitsklassifikator neben MLflow behalten, wenn die Beweise in der Laufzeit und externen Systemen leben. Das Gerät ist absichtlich klein. Es vergleicht keine LLM Rechner, prüft keinen MLflow im Maßstab, vergleicht keine Anbieter oder misst die Überwachungsdeckung nicht. Sein Wert ist die kontrollierte Mismatch: drei identische Bewertungspass, drei verschiedene Betriebszustände und eine überprüfbare Regel, die die Freigabeentscheidung erklärt. Für Teams, die mit ihren Agenten arbeiten, ist diese Grenze nützlich: Beurteilen Sie die Qualität der Ausgabe mit dem stärksten geeigneten Scorer, überprüfen Sie die operativen Fakten an ihrer Quelle und verbinden Sie sich mit den Beweisen, bevor Sie den Erfolg erklären. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine geplante Rolle ist eine gesundheitliche Schicht neben bestehenden Laufzeiten, nicht ein Ersatz für MLflow oder eine automatische Behauptung, dass eine erfolgreiche Bewertung einen gesunden Wirkstoff bedeutet. Die derzeitige öffentliche Erfahrung ist eine Frühzeit Zugang Stelle und eine Produktdemonstration; Produktionsüberwachungsadapter werden im Allgemeinen nicht versandt.