2026-08-01T07:43:58.869Z
Token-Budget-Aware LLM Razzonamento: Aggiungere una porta di qualità
Trasforma il budget di token dinamico di TALE in una politica di rilascio che salva i token di ragionamento solo quando sopravvivono risultati di qualità e verificati.
Il ragionamento LLM, consapevole del budget dei token, dovrebbe essere operato come un bilancio stimato più un cancello di rilascio, non come un'istruzione dura per pensare di meno. Il bilancio propone quanto ragionamento spendere. Un controllo separato decide se la durata più breve è accurata, se il bilancio richiesto è stato rispettato in modo significativo e se l'agente ha prodotto il risultato previsto. Tale distinzione è l'utile lezione operativa del documento Conoscenza del Token Budget LLM Razzonamento, i risultati dell'ACL 2025, dietro TALE. Il documento riporta grandi riduzioni dei token di output con un piccolo compromesso di precisione media. Essa documenta anche un fatto meno conveniente: un budget più stretto richiesto può produrre più token di uno moderato. L'operatore ha quindi bisogno di quattro possibili prossime mosse: promuovere, ampliare, rivalutazione o escalation. Leggi TALE come stimatore, non come limitatore TALE ha due applicazioni. TALE EP stima un bilancio per ciascuna domanda, aggiunge tale bilancio alla richiesta di ragionamento e chiede al modello la risposta. TALE PT genera obiettivi di formazione consapevoli del budget e internalizza il comportamento attraverso la formazione post formazione. Il pubblico Repositorio TALE rende particolarmente chiara la sequenza TALE EP: il suo script di riferimento invia una query per stimare il budget e una seconda query per produrre la risposta, quindi valuta il risultato. Nel dettagliato confronto TALE EP del documento, la precisione media della catena di pensiero della vaniglia ha raggiunto l'83,75% con 461,25 token di uscita per campione. TALE EP ha raggiunto l'81,03% utilizzando il 32% dei token di produzione di vaniglia e il 41% delle sue spese misurate. Il documento riporta anche una riduzione media del 68,64% dei token di uscita in quel confronto. Questi numeri sono la prova di un metodo, non di una promessa di livello di servizio. Essi provengono dalla configurazione dei benchmark degli autori, dai modelli, dai suggerimenti e dagli evaluatori. Il tuo carico di lavoro può includere gli effetti degli strumenti, il recupero, le autorizzazioni o un risultato la cui correttezza non può essere ridotta a una risposta matematica esatta. La query extra dell'estimatore appartiene anche al libro dei costi e della latenza anche quando la seconda risposta più breve domina il risparmio. Il corretto default è ancora pratico: stimare un budget per classe di attività, testarlo contro una linea di base e tenerlo solo quando il predicato dello stesso risultato passa. Non copiare una percentuale nella produzione e dire il lavoro fatto. Espettare l'elasticità del token prima di impostare il cancello Un budget di token richiesto non è necessariamente la lunghezza di uscita effettiva del modello. La carta arXiv v5 dà un esempio accurato di GPT 4o mini: Modalità di ragionamento Progetto di bilancio richiesto Token di uscita effettive Risposta : : La vaniglia catena di pensiero nessuna 258 corretto Prestazione del bilancio 50 86 corretto Prestazione del bilancio 10 157 corretto La richiesta di 50 token ha prodotto 86 token, ma ha ridotto la linea di base di due terzi e preservato la risposta. Un cancello actual <= requested letterale scarterebbe quel candidato utile. La richiesta di 10 token è andata peggio: ha prodotto 157 token, quasi il doppio della richiesta più generosa. Il giornale chiama questa elasticità simbolica. Ciò modifica la politica operativa in due modi. Innanzitutto, la conformità al bilancio ha bisogno di una dichiarazione. L'esempio di seguito permette di produrre fino al doppio del budget richiesto, ma richiede comunque un risparmio di almeno il 20% rispetto al livello di riferimento. Si tratta di valori politici che possono essere deliberatamente controllati, non di costanti universali. In secondo luogo, un'eccessiva invasione ha bisogno di una propria diagnosi. Non dimostra che la risposta sia sbagliata. Dice che l'estimatore o la restrizione di prompt non hanno controllato la lunghezza, quindi la prossima azione è quella di rivalutazione piuttosto che abbassare silenziosamente il numero di nuovo. La ricerca di bilancio ottimale del documento si basa su un approccio di monotonia morbida e riporta che il 90,91% di un campione GSM8K lo ha seguito. Tanti morbidi: i rimanenti casi sono un motivo per misurare i token effettivi, non un invito ad assumere la curva. Mettere la verifica dei risultati prima del risparmio Il cancello di rilascio dovrebbe combinare quattro domande indipendenti: 1. Risparmio di materiale: La produzione effettiva è diminuita abbastanza da giustificare un cambiamento di politica? 2. Conformità del bilancio: Il modello è rimasto all'interno della copertina consentita? 3. Toleranza di qualità: Un valutatore esatto, una suite di regressione o un punteggio limitato sono rimasti al di sopra del livello di rilascio? 4. O ricevuta di risultato: Il artefatto finale o l'effetto esterno corrispondono a quello che è stato chiesto all'agente di produrre? Il quarto controllo supera gli altri. Una risposta può essere concisa, ottenere un buon punteggio su una rubrica locale, e non riuscire comunque a inviare il messaggio, aggiornare il record o creare il file atteso. Per gli agenti utilizzatori di strumenti, immagazzinare un identificatore di destinazione, lo stato degli effetti e il risultato di verifica accanto al record del token. Non memorizzare un testo di ragionamento nascosto solo per implementare questo gate. Una funzione di decisione compatta può rimanere deterministica: L'ordine è intenzionale. Un effetto collaterale non verificabile va a una persona. Una ricevuta fallita o un eccessivo calo di qualità dà più spazio a ragionamenti. Un grave eccesso di bilancio provoca una nuova stima. Un risparmio corretto ma immateriale lascia sola la linea di base. Solo il candidato rimanente viene promosso. Eseguire il sistema di promozione di sei casi Prima di collegare la regola agli agenti in diretta, testare la politica stessa. Il dispositivo utilizzato per questo articolo comprende sei stati inconvenienti: Caso Risparmio Evidenza dei risultati Decisione : Limitati e verificati 67.9% approvato promuovere Cheap ma sbagliato 76.8% fallito ampliamento del bilancio Superamento elastico utile 66.7% approvato promuovere Il bilancio ignorato 39.2% approvato rivaluta il bilancio Effetto collaterale non verificabile 59.4% non disponibile Escalation Nessun risparmio materiale 11.0% approvato mantenere la linea di base Il caso di elasticità utile utilizza la linea di base di 258 token, la richiesta di 50 token e l'output effettivo di 86 token. Il caso ignorato dal bilancio utilizza la stessa linea di base con la richiesta di 10 token e l'uscita di 157 token. Questo è il motivo per cui la conformità è un rapporto e il motivo per cui la rivalutazione è diversa dall'ampliamento per la qualità. È possibile riprodurre il classificatore con un dispositivo JSON contenente baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore e candidate.verifiedOutcome . Eseguire la funzione di decisione per ogni riga e fallire nel test di politica se l'azione calcolata differisce dall'azione attesa. L'articolo ha superato tutti e sei i casi. Il primo esperimento di produzione dovrebbe essere ancora piccolo: scegliere una classe di attività ripetibile con un risultato deterministico; raccogliere una linea di base su percorsi sufficienti per vedere la variazione normale; aggiungere il costo stimato allo stesso libro maggiore; due o tre fasce di bilancio di prova piuttosto che un numero fragile; confrontare le ricevute di qualità e di risultato prima di confrontare il denaro; promuovere solo la band che sopravvive al cancello di rilascio; mantenere un ritorno automatico alla politica di base. Non iniziare con un flusso di lavoro irreversibile. Un gruppo di riassunti con risposte di riferimento è più sicuro di un agente che pubblica, paga, cancella o modifica i permessi. Quando il risultato è soggettivo, prova la revisione umana e registra il disaccordo invece di trasformare l'incertezza in un falso passaggio. Tenere il limite della carta attaccato alla conclusione La valutazione principale del documento si concentra su compiti di testo, tra cui GSM8K, GSM8K Zero e MathBench, e la sua sezione limitazioni dice che l'uscita multimodale non è coperta. Misura anche i token di uscita medi e l'accuratezza delle attività in base alla propria configurazione. I token di ragionamento nascosto, la contabilità specifica per il fornitore, le letture di cache, gli schemi degli strumenti e l'ingresso dell'estimatore possono cambiare la fattura che vedi altrove. L'attuazione di riferimento è il codice di ricerca. Il suo script TALE EP incollato illustra il flusso di due query e i set di dati supportati, ma include ipotesi locali e configurazione della chiave di inserimento. Trattalo come una metodologia ispezionabile, non come un pacchetto di produzione che deve funzionare invariato. Per la salute dell'agente, la conclusione difendibile è più ristretta di un ragionamento più breve. Un bilancio è utile quando riduce i rifiuti misurati e il lavoro rimane corretto, completo e verificabile. Se il modello ignora il budget, rivaluta. Se la qualità scende, allargatela. Se l'effetto non può essere verificato, aumentare. Se i risparmi sono banali, mantenete la linea di base. Sidewisp è attualmente in anteprima privata. L'uso dei token e l'intelligenza dei costi stimati sono previsti, ma quella capacità non è stata spedita oggi. La regola operativa può essere applicata in modo indipendente: lascia che il bilancio proponga; lascia che il risultato verificato decida.