2026-08-01T14:17:48.417Z

LLM Selbstbewertung: Kalibrieren Sie den Richter, bevor Sie ihm vertrauen

Verweisen Sie jedes Urteil auf deterministische Beweise, einen kriterspezifischen kalibrierten LLM Richter oder eine verantwortungsvolle menschliche Überprüfung.

LLM Selbstbewertung ist nützlich, wenn das Kriterium wirklich qualitativ ist, der Bewerter auf menschliche Etiketten für dieses genaue Kriterium getestet wurde und seine Antwort als Beweismittel behandelt wird. Es sollte nicht entscheiden, ob eine Akte existiert, eine Zahlung gelandet, ein Test bestanden oder eine Person eine unwiderrufliche Maßnahme genehmigt hat. Diese Fragen haben bereits stärkere Eigentümer: deterministische Kontrollen oder verantwortungsbewusste Menschen. Das praktische Standard ist daher ein Router, nicht ein universeller Richter. Schicken Sie mechanisch überprüfbare Ansprüche an den Code. Schicken Sie begrenzte qualitative Kriterien an einen kalibrierten Modellbewertungsbeauftragten. Schicken Sie jemandem unbekannte, unstabile oder schwerwiegende Entscheidungen. Wenn die Beweise fehlen, halten Sie das Urteil unknown . Ein LLM Richter kann nützlich sein, ohne autoritätsvoll zu sein. Selbstbewertung bedeutet, einen LLM zu bitten, seine eigene Leistung oder die Leistung eines anderen Modells zu beurteilen. Ein zweiter Pass kann einen offensichtlichen Widerspruch erkennen, zwei Zusammenfassungen vergleichen oder eine Antwort mit einer Rubrik beurteilen. Erfahren Sie den Überblick von Prompting zeigt das grundlegende Muster: Erzeugen Sie eine Antwort und bitten Sie dann ein Modell, sie zu kritisieren oder zu überarbeiten. Die Forschung gibt diesem Muster eine glaubwürdige, aber begrenzte Rolle. Ren und Kollegen hat die offene Selbstbewertung als Vorhersagen auf Token Ebene neu formuliert und für ihre getesteten PaLM 2 und GPT 3 Einstellungen eine bessere Genauigkeit der selektiven Generation und eine stärkere Korrelation mit der Ausgangsqualität auf TruthfulQA und TL;DR gemeldet. Eine neuere Studie über mehrstufige Aufgaben ergab, dass Schrittweise Selbstbewertung bei zwei Benchmark Datensätzen die ganzheitliche Scoring für die Fehlererkennung mit einer relativen Erhöhung der AUC ROC von bis zu 15% übertraf. Keine der beiden Ergebnisse verwandelt eine Vorlagebeurteilung in eine Lieferbewilligung. Sie zeigen, dass Selbstbewertung eine Entscheidung unter bestimmten Aufgaben, Anfragen, Modellen und Datensätzen verbessern kann. Die vertrauenswürdige Einheit ist die getestete Evaluierkonfiguration, nicht der Satz "LLM Richter". Es gibt auch bekannte Ausfallmodi. Die Zeitung MT Bench und Chatbot Arena berichtet, dass starke Richter mehr als 80% Übereinstimmung mit menschlichen Präferenzen in seiner Einstellung erreicht haben, während Position, Verbosität, Selbstverbesserung und Argumentationsvorsprüche dokumentiert werden. Die Vereinbarung ist ermutigend; die Voreingenommene Liste ist operationell entscheidend. Ein Richter kann im Durchschnitt nützlich sein und trotzdem das einzige Urteil, das wichtig ist, rückgängig machen. Die Positionsvorurteile sind leicht zu testen. Beurteilen Sie Kandidaten A und B, tauschen Sie ihre Bestellung aus, ohne ihren Inhalt zu ändern, und bewerten Sie erneut. Wang und Kollegen zeigte, dass Änderungen in der Reihenfolge die Paare Rankings wesentlich verändern könnten und eine Kalibrierung der ausgeglichenen Position plus menschliche Eskalation vorgeschlagen hatte. Wenn sich der bevorzugte Kandidat nach dem Swap ändert, wird unstable aufgezeichnet. Vergessen Sie den Widerspruch nicht in eine selbstbewusste Punktzahl. Befrieren Sie das Kriterium, bevor Sie den Richter kalibrieren "Qualität" ist zu groß, um kalibriert zu werden. Ein Richter, der eine klare Zusammenfassung anerkennt, kann bei der Tatsachenbegründung, bei der Auslegung der Politik oder bei der Beweismittelzufriedenheit immer noch unzuverlässig sein. Definition eines Kriteriums mit einem engen Vertrag: Der Kalibrierungssatz benötigt Beispiele, die der Bewertungsbeauftragte nicht geschrieben hat, Etiketten von den Personen, die das Kriterium besitzen, und genug schwierige Negative, um schmeichelhafte oder übermäßig zulässige Bewertungen aufzudecken. Einfrieren Sie den Modell Identifikator, den Richter Propost, die Rubrik, die Beispiele, den Ausgangsparser und die Schwelle zusammen. Eine Änderung an einer von ihnen erzeugt eine neue Evaluierungsversion. Die menschlichen Etiketten sind in diesem Prozess keine Peinlichkeit; sie definieren das Ziel. Die Autoren von EvalGen beschreibt "Kriterien Drift": Menschen verfeinern oft, was sie mit einem Kriterium meinen, nachdem sie echte Ergebnisse gesehen haben. Das ist ein Grund für Versionskriterien und Etiketten, nicht ein Grund, das Urteil hinter einem Modell Score zu verbergen. Messen Sie mindestens diese Eigenschaften nach Kriterium: Vereinbarung gegen verweilte menschliche Kennzeichnungen; falsche Durchgangsrate, da ein Bewertungsbeauftragter, der eine schlechte Ausgabe genehmigt, falschen Erfolg erzeugt; unknown Rate, die eine fehlende Abdeckung aufweist; Stabilität bei Kandidatenbestellungen und unerheblichen Formatierungsänderungen; Abdeckung nach Sprache, Aufgabenfamilie, Einflussklasse und Ausgangslänge; Die Kommission hat die Kommission mit dem Vorschlag für eine Verordnung (EG) Nr. 1271/2006 in Kraft gesetzt. Kombinieren Sie keine unabhängigen Kriterien in einem beruhigenden Durchschnitt. Nehmen wir an, Klarheit hat 100% Einverständnis, Gründlichkeit 75% und Sicherheit hat nur zwei bezeichnete Beispiele. Eine 88% gemischte Punktzahl kann verbergen, dass es keine verteidigbare Sicherheitsgate gibt. Halten Sie die drei Reihen getrennt. Schwellenwerte sind politische Entscheidungen, nicht Konstanten aus einem Papier. Ein Team kann 80% für einen Stilvorschlag mit geringem Einfluss akzeptieren und einen deterministischen Beweis für einen Einsatzeffekt benötigen. Die wichtige Eigenschaft ist, dass der Schwellenwert eingefroren wird, bevor der Freigabekandidat erzielt wird. Wiederholen Sie ein Kalibrierungsport Die folgende Festung verwendet vier Kriterien und acht Routing Fälle. Seine Schwelle ist bewusst einfach: mindestens drei menschlich gekennzeichnete Beispiele, mindestens 80% Einverständnis und keine Gewinneränderung im Rahmen der Reversation der Ordnung. Die Entscheidungsregel ist klein: Führen Sie das komplette Gerät mit: Die Wiedergabe erzeugt: Zwei Beobachtungen sind wichtiger als die kompakten Zahlen. Zuerst enthält das Gerät ein fehlendes Liefermaterial, das der Richter pass nennt. Der Router gibt deterministische fail zurück. Es enthält auch eine Schecksumme, die dem Richter nicht gefällt; der Router gibt deterministische pass zurück. Ein Modell kann über die Präsentation kommentieren, kann aber keine Beweise überwinden, ob das versprochene Objekt existiert und übereinstimmt. Zweitens hat die Qualität in Paaren die perfekte Übereinstimmung über vier gekennzeichnete Beispiele, ändert aber ihren Gewinner, wenn die Kandidaten ihre Bestellung austauschen. Das Tor ist immer noch gescheitert. Die historische Übereinstimmung entschuldigt einen gegenwärtigen Widerspruch nicht. Diese kleine Wiedergabe ist kein Beweis dafür, dass 80% für Ihre Anwendung sicher sind. Es ist ein überprüfbares Muster, um zu beweisen, dass jedes Urteil den richtigen Beweisbesitzer erreicht hat. Übermitteln Sie die Entscheidung an den stärksten Beweisbesitzer. Sobald die Kalibrierung abgelaufen ist, sollte die Laufzeitentscheidung drei Strecken behalten. Deterministische Strecke. Nutzen Sie Dateisystemprüfungen, Schemavalidierung, Testergebnisse, Datenbankbeschränkungen, Anmelderquittungen, Unterschriften, Schecksumme und Ziellisten, wenn sie die Frage direkt beantworten können. Aufzeichnen Sie den beobachteten Wert und die Frische. Ein Befehl, der aus Null ausgeht, beweist nur den Vertrag dieses Befehls; überprüfen Sie das beabsichtigte äußere Ergebnis separat. Juge Support Lane. Verwenden Sie einen festgelegten Evaluator für Kriterien wie Klarheit, Relevanz, Ton oder Rubrik Einhaltung, wenn die Kalibrierungskapazität dem aktuellen Fall entspricht. Beibehalten Sie das Kriterium, die Auswertungsversion, den prompt Hash, die Eingabereferenz, das Urteil, die Erklärung und die Kalibrierungsversion. Das Modell unterstützt das Urteil; die umliegende Politik entscheidet, was diese Beweise erlauben. Human review lane. Route Einflussreiche Meinungsverschiedenheiten, neue Sprachen, unbekannte Aufgabenfamilien, Ordnungsinstabilität, Ausnahmen aus der Politik und irreversible Autorität hier. Fügen Sie die widersprüchlichen Beweise und eine konkrete Frage ein. "Bitte überprüfen" ist eine schwache Routing; "Die deterministische Quittung fehlt, während der Richter sagt, vollständigkann dieser Vorfall geschlossen werden?" ist ein Handlungsbedarf. Ein unknown Ergebnis ist nützlich. Es heißt, das System kann die Behauptung derzeit nicht feststellen. Wenn man Unbekannte in Pass macht, schützt man nur das Dashboard vor unvollständigem Aussehen. Umkalibrieren Sie auf Drift, nicht nur auf einem Kalender Ein Richter kann treten, wenn sich der Modell Alias ändert, der Anruf bearbeitet wird, Beispiele neu angeordnet werden, eine neue Sprache eintrifft, die Ausgänge länger werden oder das Produkt mit einer anderen Aufgabenfamilie beginnt. Auslöserrekalibrierung dieser Änderungen und Überwachung von Live Unvereinbarkeitsproben zwischen geplanten Überprüfungen. Halten Sie zwei Grenzen sichtbar: 1. Die Selbstbewertung schätzt eine begrenzte qualitative Eigenschaft; sie beweist nicht Bereichbarkeit, nützliche Fortschritte, Werkzeugwirkungen, Gedächtnisbeständigkeit oder lieferbare Existenz. 2. Ein kalibrierter Evaluator reduziert die Überprüfungslast; er erhält keine menschliche Autorität über Geheimnisse, Ausgaben, Veröffentlichung, Löschung oder andere irreversible Handlungen. Das Ergebnis ist eine weniger theatrische Form der AI Bewertung. Der Richter bekommt einen nützlichen Job, die deterministischen Beweise halten ihre stärkere Arbeit, und die Leute behalten die Entscheidungen, die ihnen gehören. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Es wird als Gesundheitsschicht um die bestehenden Agentenlaufzeiten entwickelt, aber die Sammlung und Wiederherstellung von Produktionsagent Gesundheit werden nicht im aktuellen Web Repository versandt. Wenn dieses Problem mit der Beweisleitung mit dem, wie Sie Agenten bedienen, übereinstimmt, können Sie sich der privaten Vorschau Warteliste anschließen, ohne den Artikel als Anspruch einer Live Monitoring Integration zu betrachten.