2026-08-01T07:43:58.201Z

LLM Raisonnement: ajouter une passerelle de qualité

Transformez le budget de jetons dynamiques de TALE en une politique de libération qui n'épargne les jetons de raisonnement que lorsque la qualité et les résultats vérifiés survivent.

Le raisonnement LLM en fonction du budget des jetons devrait être utilisé comme un budget estimé plus une porte de sortie, et non comme une instruction difficile à penser moins. Le budget propose combien de raisonnement à dépenser. Une vérification distincte détermine si le court laps de temps est exact, si le budget demandé a été respecté de manière significative et si l'agent a produit le résultat prévu. Cette distinction est la leçon opérationnelle utile dans le document Partage des informations sur le budget LLM Le raisonnement, les conclusions de l'ACL 2025 derrière TALE. L'article rapporte de grandes réductions des jetons de sortie avec un faible compromis de précision moyen. Il démontre également un fait moins pratique: un budget plus strict peut produire plus de jetons qu'un budget modéré. Un opérateur a donc besoin de quatre prochaines actions possibles pour promouvoir, élargir, réévaluer ou augmenter un seul plafond fixe. Lisez TALE comme un estimateur, pas un limitateur TALE a deux implémentations. TALE EP évalue un budget pour chaque question, ajoute ce budget à la demande de raisonnement, puis demande au modèle la réponse. TALE PT génère des objectifs de formation en fonction du budget et intériore le comportement par le biais de la formation postérieure. Le public Référentiel TALE rend la séquence TALE EP particulièrement claire: son script de référence envoie une requête pour estimer le budget et une seconde pour produire la réponse, puis évalue le résultat. Dans la comparaison détaillée TALE EP du document, la précision moyenne de la chaîne de pensée de la vanille a atteint 83,75% avec 461,25 jetons de sortie par échantillon. TALE EP a atteint 81,03% en utilisant 32% des jetons de sortie de vanille et 41% de ses dépenses mesurées. L'article rapporte également une réduction moyenne de 68,64% des jetons de sortie dans cette comparaison. Ces chiffres sont la preuve d'une méthode, pas une promesse de niveau de service. Ils proviennent de la configuration, des modèles, des instructions et des évaluateurs de référence des auteurs. Votre charge de travail peut inclure des effets d'outil, la récupération, les autorisations ou un produit dont la précision ne peut être réduite à une réponse mathématique exacte. La requête supplémentaire de l'estimateur appartient également au registre des coûts et de la latence, même lorsque la seconde réponse plus courte domine l'épargne. La bonne méthode par défaut est toujours pratique: estimer un budget par classe de tâches, le tester par rapport à une ligne de base et ne le conserver que lorsque le même prédicateur de résultats passe. Ne copiez pas un pourcentage dans la production et dites que le travail est fait. Attendez vous à l'élasticité des symboles avant de mettre la porte Un budget de jeton demandé n'est pas nécessairement la longueur réelle de sortie du modèle. Le papier arXiv v5 donne un exemple précis sur le GPT 4o mini: Mode de raisonnement Budgets demandés Tokens de sortie réels Réponse : : La chaîne de pensée de la vanille aucun 258 correcte Rapidement informé du budget 50 86 correcte Rapidement informé du budget 10 157 correcte La demande de 50 jetons a produit 86 jetons, mais elle a réduit la ligne de base de deux tiers et a préservé la réponse. Une porte actual <= requested littérale jetterait ce candidat utile. La demande de 10 jetons s'est détériorée: elle a produit 157 jetons, presque le double de la demande plus généreuse. Le journal appelle cela l'élasticité symbolique. Cela modifie la politique d'exploitation de deux façons. Premièrement, la conformité budgétaire nécessite une enveloppe déclarée. L'exemple ci dessous permet une production réelle jusqu'à deux fois plus élevée que le budget demandé, mais nécessite toujours une économie d'au moins 20% par rapport à la valeur de référence. Il s'agit de valeurs politiques qui peuvent être délibérément vérifiées et non de constantes universelles. Deuxièmement, une survenance extrême a besoin d'un diagnostic personnel. Cela ne prouve pas que la réponse est erronée. Il dit que l'estimatrice ou la contrainte de prompt n'a pas contrôlé la longueur, donc l'action suivante est de réestimer plutôt que de réduire silencieusement le nombre à nouveau. La recherche de budget optimal du papier repose sur une approximation de la monotonie douce et rapporte que 90,91% d'un échantillon GSM8K l'ont suivi. Les cas restants sont une raison de mesurer les jetons réels, et non une invitation à supposer la courbe. Mettre la vérification des résultats avant l'épargne La porte de sortie devrait combiner quatre questions indépendantes: 1. Economie de matériel: Est ce que la production réelle a suffisamment diminué pour justifier un changement de politique? 2. Conformité au budget: Le modèle est il resté dans l'enveloppe autorisée de survol? 3. Tolérance de qualité: Un évaluateur exact, une suite de régression ou un score limité sont ils restés au dessus du sol de libération? 4. O reçu de résultat: Est ce que l'artefact final ou l'effet externe correspondent à ce que l'agent a été invité à produire? Le quatrième contrôle dépasse les autres. Une réponse peut être concise, donner un bon score sur une rubrique locale, et ne pas envoyer le message, mettre à jour le dossier ou créer le fichier attendu. Pour les agents utilisant des outils, stockez un identifiant de destination, l'état des effets et le résultat de vérification à côté du registre des jetons. Ne stockez pas de texte caché de raisonnement juste pour mettre en œuvre cette passerelle. Une fonction de décision compacte peut rester déterministe: L'ordre est intentionnel. Un effet secondaire non vérifiable se produit chez une personne. Un reçu raté ou une baisse excessive de qualité donne plus de place à la raison. Un dépassement budgétaire sévère déclenche une réévaluation. Une économie correcte mais immatérielle laisse la ligne de départ seule. Seul le candidat restant est promu. Exécutez la promotion de six cas Avant de connecter la règle aux agents en direct, testez la police elle même. L'appareil utilisé pour cet article couvre six états inconvenients: Le cas de l'accusé Épargne Les preuves des résultats Décision : Limités et vérifiés 67.9% a été adoptée promouvoir Pas cher mais mal 76.8% échec élargir le budget Remplacement élastique utile 66.7% a été adoptée promouvoir Le budget ignoré 39.2% a été adoptée réévaluer le budget Effets secondaires non vérifiables 59.4% non disponible l'escalade Aucune économie de matériel 11.0% a été adoptée maintenir la ligne de départ Le cas d'élasticité utile utilise la ligne de base de 258 jetons du papier, la demande de 50 jetons et la sortie réelle de 86 jetons. Le cas ignoré par le budget utilise la même ligne de base avec la demande de 10 jetons et la sortie de 157 jetons. C'est pourquoi la conformité est un ratio et pourquoi la réévaluation est différente de l'élargissement de la qualité. Vous pouvez reproduire le classificateur avec un appareil JSON contenant baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore et candidate.verifiedOutcome . Exécuter la fonction de décision pour chaque ligne et échouer à l'essai de politique si l'action calculée diffère de l'action attendue. L'article a passé les six cas. La première expérience de production devrait encore être petite: choisir une classe de tâches répétables avec un résultat déterministe; recueillir une ligne de base sur des courbes suffisantes pour voir la variance normale; ajouter le coût de l'estimation au même registre; deux ou trois bandes budgétaires d'essai au lieu d'un nombre fragile; comparer les reçus de qualité et les résultats avant de comparer l'argent; promouvoir uniquement la bande qui survit à la porte de sortie; maintenir un retour automatique à la politique de référence. Ne commencez pas par un flux de travail irréversible. Un lot de résumés avec des réponses de référence est plus sûr qu'un agent qui publie, paie, supprime ou modifie les autorisations. Lorsque le résultat est subjectif, prenez l'échantillon de l'examen humain et enregistrez le désaccord au lieu de transformer l'incertitude en un faux passe. Gardez la limite du papier attachée à la conclusion L'évaluation principale du document se concentre sur les tâches textuelles, y compris GSM8K, GSM8K Zero et MathBench, et sa section sur les limites indique que la sortie multimodal n'est pas couverte. Il mesure également les jetons de sortie moyens et la précision des tâches dans sa propre configuration. Les jetons de raisonnement cachés, la comptabilité spécifique au fournisseur, les lectures de cache, les schémas d'outils et l'entrée de l'estimatrice peuvent modifier la facture que vous voyez ailleurs. La mise en œuvre de référence est le code de recherche. Son écriture TALE EP collée illustre le flux de deux requêtes et les ensembles de données pris en charge, mais il inclut des hypothèses locales et la configuration de la clé placeholder. Traitez le comme une méthodologie inspectable, et non comme un ensemble de production à fonctionner inchangé. Pour la santé de l'agent, la conclusion défendable est plus étroite que un raisonnement plus court est préférable. Un budget est utile lorsqu'il réduit les déchets mesurés et le travail reste correct, complet et vérifiable. Si le modèle ignore le budget, réestimez. Si la qualité diminue, élargissez la. Si l'effet n'est pas vérifié, intensifier. Si les économies sont triviales, gardez la ligne de départ. Sidewisp est actuellement en préversion privée. L'utilisation des jetons et l'intelligence des coûts estimés sont prévues, mais cette capacité n'est pas expédiée aujourd'hui. La règle de fonctionnement peut être mise en œuvre de manière indépendante: laissez le budget proposer; laissez le résultat vérifié décider.