2026-08-01T07:43:57.481Z
Token-Budget-Aware LLM Argumentation: Fügen Sie ein Qualitätsport hinzu
Verwandeln Sie das dynamische Token-Budget von TALE in eine Release-Politik, die Argumentationstoken nur speichert, wenn Qualität und überprüfte Ergebnisse überleben.
Die LLM Rahmung, die sich mit dem Token Budget befasst, sollte als geschätztes Budget plus ein Release Gate betrieben werden, nicht als eine harte Anweisung, weniger zu denken. Eine separate Prüfung entscheidet, ob der kürzere Ablauf korrekt ist, ob der angeforderte Budget sinnvoll eingehalten wurde und ob der Agent das beabsichtigte Ergebnis erzielt hat. Diese Unterscheidung ist die nützliche operative Lektion in LLM Verständnis für Token Budget, den Ergebnissen des ACL 2025 Papiers hinter TALE. Das Papier berichtet über große Reduktionen der Output Token mit einem kleinen durchschnittlichen Genauigkeits Kompromiss. Es dokumentiert auch eine weniger bequeme Tatsache: Ein strengeres gefordertes Budget kann mehr Token erzeugen als ein moderates. Ein Betreiber benötigt daher vier mögliche nächste Schritte, um keine feste Grenze zu fördern, zu erweitern, neu zu schätzen oder zu erhöhen. Lesen Sie TALE als Schätzer, nicht als Begrenzer TALE hat zwei Implementierungen. TALE EP schätzt für jede Frage einen Haushalt, fügt diesen Haushalt in die Begründungsanforderung hinzu und bittet das Modell danach um die Antwort. TALE PT erzeugt budgetgerechte Trainingsziele und internalisiert das Verhalten durch Post Training. Die öffentliche TALE Repository macht die TALE EP Sequenz besonders klar: Das Referenzschrift sendet eine Abfrage zur Schätzung des Budgets und eine zweite Abfrage zur Erstellung der Antwort und bewertet dann das Ergebnis. Im detaillierten TALE EP Vergleich des Papiers erreichte die Vanille Gedankenkette eine durchschnittliche Genauigkeit von 83,75% mit 461,25 Ausgangs Token pro Probe. TALE EP erreichte 81,03% bei der Verwendung von 32% der Vanille Ausgabe Token und 41% seiner gemessenen Ausgaben. Das Papier berichtet auch über eine durchschnittliche Verringerung der Output Token um 68,64% in diesem Vergleich. Diese Zahlen sind Beweise für eine Methode, nicht für ein Versprechen. Sie stammen aus der Benchmarkkonfiguration, Modellen, Anfragen und Evaluatoren der Autoren. Ihre Arbeitsbelastung kann Werkzeugeffekte, Abrufe, Berechtigungen oder ein Ergebnis umfassen, dessen Richtigkeit nicht auf eine genaue mathematische Antwort reduziert werden kann. Die zusätzliche Abfrage des Schätzers gehört auch in das Kosten und Latenzbuch, auch wenn die kürzere zweite Reaktion die Einsparung dominiert. Die korrekte Standardregelung ist immer noch praktisch: Schätzen Sie ein Budget pro Aufgabenklasse, testen Sie es gegen eine Basislinie und behalten Sie es nur, wenn das gleiche Ergebnisprädikat abläuft. Kopieren Sie keinen Prozentsatz in die Produktion und nennen Sie den Job erledigt. Erwarten Sie Elastizität vor der Einrichtung des Tores Ein gewünschtes Tokenbudget ist nicht unbedingt die tatsächliche Ausgangslänge des Modells. Die ArXiv v5 Papier gibt ein scharfes Beispiel für GPT 4o mini: Der Begründungsmodus Geforderter Haushalt Tatsächliche Ausgabe Token Antwort : : Vanille Gedankenkette keine 258 Richtig Budgetkenntnis schneller 50 86 Richtig Budgetkenntnis schneller 10 157 Richtig Die Anfrage um 50 Token erzeugte 86 Token, aber sie reduzierte die Basislinie um zwei Drittel und bewahrte die Antwort. Ein buchstäbliches actual <= requested Tor würde diesen nützlichen Kandidaten abwerfen. Die 10 Token Anfrage ging schlechter: sie erzeugte 157 Token, fast doppelt so viel wie die großzügiger Anfrage. Das Papier nennt dies symbolische Elastizität. Dies ändert die Betriebsrichtlinie auf zwei Arten. Erstens ist die Einhaltung des Haushaltsplans durch einen angemeldeten Umschlag erforderlich. Die nachstehende Beispielregelung erlaubt eine tatsächliche Ausgabe von bis zu doppelt so viel wie der angeforderte Budget, erfordert aber trotzdem eine Einsparung von mindestens 20% gegenüber dem Ausgangswert. Das sind bewusst überprüfbare politische Werte, nicht universelle Konstanten. Zweitens braucht ein extremer Überfall eine eigene Diagnose. Es beweist nicht, daß die Antwort falsch ist. Es heißt, dass der Schätzer oder die Schnellbeschränkung die Länge nicht kontrolliert hat, also ist die nächste Aktion, die Zahl neu zu schätzen, anstatt die Zahl wieder still zu senken. Die Optimums Budget Suche des Papiers beruht auf einer weichen Monotonicitäts Approximation und berichtet, dass 90,91% einer GSM8K Probe folgte. Soft Matters: Die übrigen Fälle sind ein Grund, um tatsächliche Token zu messen, nicht eine Einladung zur Annahme der Kurve. Stellen Sie die Ergebnisüberprüfung vor der Einsparung Das Freigabe Gate sollte vier unabhängige Fragen kombinieren: 1. Materialersparnis: Ist die tatsächliche Produktion zu niedrig genug, um eine Änderung der Politik zu rechtfertigen? 2. Budget Konformität: Ist das Modell innerhalb des zulässigen Überfallgehäuses geblieben? 3. Qualitätstoleranz: Hat ein genauer Evaluator, eine Regressionssuite oder eine begrenzte Punktzahl über dem Freisetzungsgeschoss geblieben? 4. OErgebnisbegriff: Hat das endgültige Artefakt oder die äußere Wirkung mit dem übereinstimmen, was der Agent produzieren soll? Der vierte Check übertrifft die anderen. Eine Antwort kann präzise sein, eine gute Punktzahl auf einer lokalen Rubrik erzielen und trotzdem nicht die Nachricht senden, die Aufzeichnung aktualisieren oder die erwartete Datei erstellen. Für Werkzeugverwender speichern Sie neben der Token Date einen Bestimmungsidentifikator, einen Effektstatus und ein Verifizierungsergebnis. Speichern Sie nicht verborgene Argumentationstexte, nur um dieses Tor zu implementieren. Eine kompakte Entscheidungsfunktion kann deterministisch bleiben: Der Befehl ist absichtlich. Eine unüberprüfbare Nebenwirkung kommt auf eine Person. Eine fehlgeschlagenen Quittung oder eine übermäßige Qualitätssenkung bietet mehr Raum für Argumentation. Eine schwere Überschreitung des Budgets löst eine Neubewertung aus. Eine korrekte, aber unbedeutende Einsparung lässt die Ausgangslinie allein. Nur der verbleibende Kandidat wird befördert. Führen Sie die sechs Fälle Promotion Fix Bevor Sie die Regel mit Live Agenten verbinden, testen Sie die Politik selbst. Das für diesen Artikel verwendete Gerät umfasst sechs unangenehme Zustände: Fall Einsparungen Ausgangsgegenstände Entscheidung : Beschränkt und überprüft 67.9% verabschiedet Befördern Billig, aber falsch 76.8% gescheitert Vergrößerung des Haushaltsplans Nützliche elastische Überschreitung 66.7% verabschiedet Befördern Vernachlässigtes Budget 39.2% verabschiedet Neubewertung des Haushaltsplans Unüberprüfbare Nebenwirkungen 59.4% nicht verfügbar Eskalation Keine Materialersparnis 11.0% verabschiedet Verhalten Sie die Ausgangslinie Der Fall der Nützlichen Elastizität verwendet die Basislinie mit 258 Token, 50 Token Anforderung und 86 Token Tatsache. Der Budgetignorierte Fall verwendet die gleiche Basislinie mit dem 10 Token Anforderung und 157 Token Ausgabe. Deshalb ist die Konformität ein Verhältnis und die Neubewertung unterscheidet sich von der Qualitätsverweiterung. Sie können den Klassifikator mit einem JSON Festiment reproduzieren, der baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore und candidate.verifiedOutcome enthält. Führen Sie die Entscheidungsfunktion für jede Zeile aus und scheitern Sie den Richtlinientest, wenn sich die berechnete Aktion von der erwarteten Aktion unterscheidet. Die Artikelbefestigung hat alle sechs Fälle bestanden. Das erste Produktionsversuch sollte noch klein sein: eine wiederholbare Aufgabenklasse mit einem deterministischen Ergebnis auswählen; eine Ausgangslinie über genügend Länge zu sammeln, um die normale Varianz zu erkennen; die Schätzkosten in das gleiche Hauptbuch hinzufügen; Versuch zwei oder drei Haushaltsbänder anstelle einer zerbrechlichen Zahl; Vergleichen Sie Qualitäts und Ergebnisrechnungen, bevor Sie Geld vergleichen; nur die Band fördern, die das Freisetzungsportal überlebt; eine automatische Rückkehr zur Basispolitik zu gewährleisten. Beginnen Sie nicht mit einem irreversiblen Workflow. Ein Zusammenfassungsbatch mit Referenzantworten ist sicherer als ein Agent, der Berechtigungen veröffentlicht, bezahlt, löscht oder ändert. Wenn das Ergebnis subjektiv ist, nehmen Sie eine menschliche Überprüfung und registrieren Sie die Meinungsverschiedenheiten, anstatt die Unsicherheit in eine falsche Passform zu verwandeln. Halten Sie die Grenze des Papiers an der Schlussfolgerung fest Die wichtigste Bewertung des Papiers konzentriert sich auf Text Aufgaben, darunter GSM8K, GSM8K Zero und MathBench. Es misst auch durchschnittliche Ausgabe Token und Aufgabengenauigkeit in seinem eigenen Setup. Verborgene Argumentations Token, spezifische Buchhaltung für den Anbieter, Cache Lesungen, Tool Schemas und Schätzungs Eingabe können die Rechnung ändern, die Sie an anderer Stelle sehen. Die Referenzimplementierung ist der Forschungscode. Sein Pinned TALE EP Skript illustriert den zweifelhaften Flow und die unterstützten Datensätze, enthält jedoch lokale Annahmen und die Konfiguration von Platzhalter Schlüsseln. Behandeln Sie sie als überprüfbare Methodik und nicht als unveränderliches Produktionspaket. Für die Gesundheit des Agenten ist die verteidigungsfähige Schlussfolgerung schmaler als Kürzere Argumentation ist besser. Ein Budget ist nützlich, wenn es gemessene Abfälle reduziert und die Arbeit korrekt, vollständig und überprüfbar bleibt. Wenn das Modell das Budget ignoriert, schätzen Sie es neu. Wenn die Qualität sinkt, vergrößere sie. Wenn die Wirkung nicht nachgewiesen werden kann, eskalieren. Wenn die Ersparnisse gering sind, halten Sie die Basislinie. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Token Nutzung und geschätzte Kosten Intelligence ist geplant, aber diese Fähigkeit wird heute nicht versandt. Die Betriebsregel kann hier unabhängig umgesetzt werden: Lassen Sie den Haushalt vorschlagen; Lassen Sie das überprüfte Ergebnis entscheiden.