2026-08-01T07:43:59.738Z
Токен-бюджет-сознание LLM Разум: Добавить качество ворота
Превратите динамический бюджет TALE в политику выпуска, которая сохраняет токены рассуждения только при сохранении качественных и проверенных результатов.
Размышление LLM, ориентированное на токен бюджет, должно рассматриваться как предполагаемый бюджет плюс выпускный шлюз, а не как сложный инструктаж для думать меньше. Бюджет предлагает, сколько расчетов расходовать. Отдельная проверка определяет, является ли более короткий срок точностью, был ли должным образом выполнен запрошенный бюджет, и дал ли агент предполагаемый результат. Это различие является полезным операционным уроком в работе Токен бюджет сознание LLM Разум, выводах ACL 2025 за TALE. В статье сообщается о больших сокращениях выходной токены с небольшим средним компромиссом в точности. Он также документирует менее удобный факт: более строгий бюджет может производить больше токенов, чем умеренный. Поэтому оператору нужны четыре возможных следующих шага: продвижение, расширение, переоценка или эскалация. Читайте TALE как оценщик, а не ограничитель TALE имеет две реализации. TALE EP оценивает бюджет для каждого вопроса, добавляет этот бюджет к запросу, а затем запрашивает ответ модели. TALE PT создает целевые задачи для обучения с учетом бюджета и интернализирует поведение через посттренировку. Общественный Сберегательный фонд ТАЛЕ делает последовательность TALE EP особенно очевидной: ее справочный сценарий отправляет один запрос для оценки бюджета и второй запрос для получения ответа, а затем оценивает результат. В подробном сравнении TALE EP, проведенном в статье, ванильная цепочка мыслей достигла средней точности 83,75% с выходной токеном 461,25 на образец. TALE EP достигла 81,03% при использовании 32% токенов ванильной выработки и 41% от измеренных расходов. В статье также сообщается о сокращении выходной токены в среднем на 68,64% в этом сравнении. Эти цифры свидетельствуют о методе, а не о обещании на уровне службы. Они исходят из конфигурации, моделей, запросов и оценщиков авторских эталонов. Ваша рабочая нагрузка может включать эффекты инструмента, извлечение, разрешения или результаты, правильность которых не может быть сокращена до точного математического ответа. Дополнительный запрос оценщика также относится к бухгалтерскому учету затрат и задержек, даже когда более короткий второй ответ доминирует в экономии. Правильный дефолт по прежнему практичен: оценить бюджет на класс задач, проверить его по сравнению с базовой линией и сохранить его только после того, как пройдет один и тот же прогноз результатов. Не копируйте процент в производство и называйте работу выполненной. Ожидайте эластичность знака перед установкой ворота Запрошенный бюджет токенов не обязательно является фактической длиной выхода модели. arXiv v5 бумаги дает яркий пример GPT 4o mini: Режим рассуждения Запрошенный бюджет Фактические токены выхода Ответ : : Ванильная цепочка мыслей Никаких 258 правильный Ожидания о бюджете 50 86 правильный Ожидания о бюджете 10 157 правильный Запрос 50 токенов выпустил 86 токенов, но он сократил базовую линию на две трети и сохранил ответ. Буквальный шлюз actual <= requested отбросил бы полезного кандидата. Запрос на 10 токенов оказался хуже: он выпустил 157 токенов, почти вдвое больше, чем более щедрый запрос. Газета называет это символической эластичностью. Это изменяет операционную политику двумя способами. Во первых, соблюдение бюджета требует объявленного объема. Примерная фиксация, приведенная ниже, позволяет фактически выпустить до дважды требуемый бюджет, но она все равно требует экономии не менее 20% по сравнению с базовым уровнем. Это целенаправленно проверяемые политические ценности, а не универсальные константы. Во вторых, экстремальное нападение требует собственного диагноза. Это не доказывает, что ответ неверен. В нем говорится, что оценщик или ограничение запроса не смогли контролировать длину, поэтому следующее действие переоценить, а не снова тихо снизить число. Поиск в газете с оптимальным бюджетом опирается на приближение мягкой монотонности, и сообщает, что 90,91% образца GSM8K последовали за ним. мягкие вопросы: оставшиеся случаи являются основанием для измерения фактических токенов, а не приглашением принять кривую. Прежде чем сэкономить, следует проверить результаты. Пусковые ворота должны сочетать в себе четыре независимых вопроса: 1. Сбережение материала: Достаточно ли фактический объем производства упал, чтобы оправдать изменение политики? 2. Соответствие бюджету: Остался ли модель в пределах допустимого объема перевал? 3. Качественная толерантность: Остался ли точный оценщик, регрессионный комплект или ограниченный балл выше уровня выпуска? 4. O полученный результат: Совпадает ли окончательный артефакт или внешний эффект с тем, что было предложено агенту произвести? Четвертая проверка превосходит остальные. Ответ может быть кратким, дать хороший результат на местной рубрике, но все же не отправить сообщение, обновлять запись или создать ожидаемый файл. Для агентов, использующих инструменты, храните идентификатор назначения, статус эффекта и результат проверки рядом с записью токенов. Не храните скрытый текст для рассуждения только для реализации этой ворота. Комплексная функция решения может оставаться детерминистической: Приказ преднамеренный. Непроверяемый побочный эффект происходит у человека. Неудачный квитанция или чрезмерное снижение качества получает больше места для рассуждений. Сильное превышение бюджета вызывает переоценку. Правильное, но нематериальное сбережение оставляет исходную линию в одиночку. Только оставшийся кандидат будет повышен. Запустите шесть случаев продвижения Прежде чем подключить правило к живым агентам, проверьте саму политику. В данной статье используются шесть неблагоприятных условий: Дело Сбережение Доказательства результатов Решение : Ограниченные и проверенные 67.9% принято содействовать Дешевый, но неправильный. 76.8% неудача расширить бюджет Полезный эластичный перевал 66.7% принято содействовать Бюджет проигнорирован 39.2% принято переоценка бюджета Непроверяемый побочный эффект 59.4% недоступна эскалация Не сэкономить материалы 11.0% принято сохранять базовую линию В случае полезной эластичности используется базовая линия бумаги на 258 токенов, запрос на 50 токенов и фактический выход на 86 токенов. В случае, в котором бюджет игнорируется, используется та же базовая линия с запросом на 10 токенов и выходом на 157 токенов. Вот почему соответствие является соотношением и почему переоценка отличается от расширения качества. Вы можете воспроизвести классификатор при помощи приспособления JSON, содержащего baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore и candidate.verifiedOutcome . Используйте функцию решения для каждого ряда и не выполните проверку политики, если вычисленное действие отличается от ожидаемого действия. Статья прошла все шесть дел. Первый производственный эксперимент должен быть еще небольшим: выбрать один класс повторяемых задач с детерминистическим результатом; собирать базовую линию по достаточном пробегам, чтобы увидеть нормальную варианцию; добавить стоимость оценки в тот же бухгалтерский учет; два или три пробных бюджетных диапазона, а не один хрупкий номер; сравнивать доходы по качеству и результатам, прежде чем сравнивать деньги; продвигать только группу, которая переживает выходную дверь; сохранять автоматическое возвращение к базовой политике. Не начинайте с необратимого рабочего процесса. Резюме с ответами по ссылке безопаснее, чем агент, который публикует, платит, удаляет или изменяет разрешения. Когда результат субъективен, обратите внимание на человеческий анализ и запишите разногласия, вместо того чтобы превратить неопределенность в ложный пропуск. Сохраняйте границу бумаги прикрепленной к выводу Основная оценка статьи сосредоточена на текстовых задачах, включая GSM8K, GSM8K Zero и MathBench, а в разделе ограничений говорится, что мультимодальный выход не охвачен. Он также измеряет средние токены выхода и точность задач в рамках собственной настройки. Скрытые токены рассуждения, учетные записи для конкретного поставщика, чтения в кеше, схемы инструментов и вход в оценщик могут изменить счет, который вы видите в других местах. Референтная реализация исследовательский код. Его записанный сценарий TALE EP иллюстрирует поток двух запросов и поддерживаемые наборы данных, но он включает в себя местные предположения и конфигурацию ключа задерживающего место. Обращайтесь с ним как с проверяемой методологией, а не как с неизменным производственным пакетом. Для здоровья агента обоснованный вывод более узкий, чем краткое рассуждение лучше. Бюджет полезен, когда он сокращает измеренные отходы и работа остается правильной, полной и проверяемой. Если модель игнорирует бюджет, переоценить. Если качество падает, расширь его. Если эффект не может быть подтвержден, эскалации. Если сбережения незначительны, сохраняйте базовую линию. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Планируется использование токенов и расчетная разведка стоимости, но эта способность не будет поставлена сегодня. Здесь правило функционирования может быть реализовано самостоятельно: пусть бюджет предлагает, пусть проверенный результат решает.