2026-08-01T07:44:01.373Z

トークン・予算知性 LLM 推論:品質ゲートを追加

TALEのダイナミックなトークン予算を,品質と検証された結果が生き残った場合にのみ推論トークンを保存するリリースポリシーに変換します.

トークン予算に配慮したLLM推論は,予算の推定額とリリースゲートとして動作すべきであり, 考えることを減らすための厳しい指示ではない.予算は,どれだけの推論を費やすべきかを提案する. 特別チェックにより,短期間が正確か,要求された予算が妥当に遵守されたか,そして代理人が意図された結果が得られたか決定されます. この区別は,TALEの背後にあるACL 2025の発見であるトークン・予算・認識 LLM 推論の有用な運用レッスンである. 紙は,平均精度の小幅なトレードオフと,大きな輸出トークンの減少を報告しています. また,要求された予算が適度な予算よりも もっと トークンを生産できるという不都合な事実も文書化されています. したがって,事業者は4つの可能な次の動きを必要とします 促進,拡大,再評価,または上昇 固定制限はありません. TALE を 制限者 で は なく 推定 者 と し て 読む TALEには2つの実装があります. TALE EPは各質問に対する予算を推定し,その予算を理由提示に追加し,その後にモデルに答えを求めます. TALE PTは,予算を意識したトレーニング目標を生成し,訓練後の行動を内在化します. 公共のTALE リポジトリは,TALE EPのシーケンスを特に明確にする.その参照スクリプトは,予算を推定するために1つの問い合わせを送信し,答えを出すために2番目の問い合わせを送信し,結果を評価する. 論文の詳細なTALE EP比較では,バニル思考チェーンはサンプルごとに 461.25 の出力トークンで平均精度が 83.75% に達しました. TALE EPは,バニル輸出トークンの32%,測定コストの41%を利用しながら81.03%に達した. また,この比較では平均 68.64% の輸出トークンの減少も報告されています. その数字は サービスレベルでの約束ではなく 方法の証拠です 作者のベンチマーク構成,モデル,提示,評価者から得られます. ツール効果,検索,許可,または正確な数学の答えに 絞り込むことができない 成果物なども含まれます 推定者の追加クエリは,短く2番目の応答が貯蓄を支配している場合でも,コストと遅延のレジューに含まれます. 正確なデフォルトは,まだ実用的です.タスククラスごとに予算を推定し,ベースラインとテストし,同じ結果予告が通過するときにのみ保持します. 百分数を生産にコピーして 作業を完了と呼んではいけません ゲートを設定する前に符号の弾力性を期待する 要求されたトークン予算は,モデルの実際の出力長さとは限らない. arXiv v5紙は,GPT 4o miniについて鋭い例を示しています. 推論モード 要求された予算 実際の出力トークン 答え : : ヴァニラ 思考の連鎖 どれか 258 正確な 予算を把握する速やかに 50 86 正確な 予算を把握する速やかに 10 157 正確な 50トークンの要求は 86トークンを生み出しましたが ベースラインを 2/3削減し 答えを保存しました 文字通り actual <= requested ゲートが その有用な候補者を排除します 10トークンのリクエストは 157トークンを生産し より寛大なリクエストのほぼ2倍でした 紙はこれを 象徴的な弾力性と呼びます これは2つの方法で運営方針を変更します. まず,予算の遵守は宣言された封筒が必要です. 下記の例は,実際の出力を要求された予算の2倍まで可能にしますが,それでもベースラインと比較して少なくとも20%の節約が必要です. これらは意図的に検証可能な政策価値であって,普遍的な定数ではない. 第二に 極端な侵攻は 診断が必要なのです 答えが間違っているとは証明しません 計算機やプロンプトの制限が 長さを制御できず 次の操作は 再び数字を 静かに下げるのではなく 再評価することです 論文の最適予算検索は,柔らかい単調性近似に基づいています. GSM8Kサンプルの90.91%がそれに従ったと報告されています. 軟問題:残りのケースは,実際のトークンを測定する理由であり,曲線を想定する誘因ではありません. 貯蓄に先立って成果検証を進めます 放出ゲートは4つの独立した質問を組み合わせなければならない. 1. 物質の節約: 政策変更を正当化するために実際の生産量は減少したのでしょうか? 2. 予算遵守: モデルが許可されたオーバーランク内にとどまったのか? 3. 品質許容性: 正確な評価器,レグレーションセット,または制限されたスコアはリリースフロア以上にとどまったか? 4. O出品領収書: 最終的な手品または外部効果は代理人に生産するように要求されたものと一致していたか? 4番目のチェックは他のチェックを上回る 答えが簡潔で ローカル rubric で良いスコアを付けても メッセージを送ったり 記録を更新したり 期待されたファイルを作成したりできなくなります ツールを使用するエージェントについては,目的地識別子,効果状態,検証結果をトークン記録の横に保存します. このゲートを実行するために 隠された推論テキストを保存しないでください. コンパクトな決定関数は決定的なままでいい. 命令は意図的だ 確認できない副作用が ある人に起こるのです 失敗した領収書や 品質の低下が 理由を考える余地が増えます 予算の過小さにより 予算の評価が変わります 正確で不重要な貯蓄は ベースラインにしかなりません 残りの候補者だけが昇進する. 6件のプロモーションを実行する 規則を実用代理に 接続する前に ポリシーそのものをテストしてください この記事では,6つの不都合な状態をカバーしています ケース 貯蓄 成果の証拠 決定 : 制限および検証 67.9% 通過した 促進する 低価格で誤った 76.8% 失敗した 予算を拡大する 有用な弾性オーバーラン 66.7% 通過した 促進する 予算は無視されました 39.2% 通過した 予算を再評価する 確認できない副作用 59.4% 入手できない 拡大する 材料の貯蓄なし 11.0% 通過した ベースラインを維持する ユーティリティー・エラスティシティケースでは,紙の258トークンベースライン,50トークンリクエスト,86トークン実際の出力を使用します. 予算を無視したケースでは 10トークン要求と 157トークン出力と同じベースラインを使用しています そのため,合致は比率であり,再評価は品質の拡大とは異なります. クラシファーを再現できます. JSON 含有する固定装置 baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore そして candidate.verifiedOutcome . 各行で決定関数を実行し,計算されたアクションが予想されたアクションと異なる場合,ポリシーテストに失敗します. 記事の固定は6つのケースをすべて合格しました 最初の生産実験は,まだ小さいものでなければならない. 決定的な結果を持つ重複可能なタスククラスを選択する. 標準差異を見るのに十分な走路で基線を収集する. 同じ本帳に推定コストを追加する. 試行は1つの脆弱な数字ではなく,2~3つの予算帯; 貨幣を比較する前に,品質と結果の領収を比較する. 放出ゲートに生き残ったバンドのみを宣伝する ベースラインポリシーに自動的に戻る. 逆戻りのないワークフローから始めないで下さい. 概要の回答が 公開,支払,削除,または変更の許可のエージェントより安全です 結果が主観的な場合 不確実性を偽りのパスに変える代わりに 人間のレビューをサンプルにして 意見の不一致を記録してください 論文の境界線を結論に結びつけておく 論文の主な評価は GSM8K, GSM8K Zero,MathBenchを含むテキストタスクに焦点を当てており,その制限セクションではマルチモダルの出力がカバーされていないとされています. また,独自の設定で平均出力トークンとタスク精度を測定します. 隠された推論トークン,プロバイダー専用の会計,キャッシュ読み込み,ツール・スケーマ,推定入力などで 他の場所で見られる請求書が変わります 参考実装は研究コードです TALE EPスクリプトを固定したは2つのクエリフローとサポートされたデータセットを説明しますが,ローカル仮定とプレスホルダーキー構成を含みます. 検査可能な方法として扱ってください. 変更のない生産パッケージではなく. 予算は測定された廃棄物を減らすとき有用です そして 作業は正確であり,完全であり,検証できます. モデルが予算を無視するなら 再評価する 質が下がれば 幅を広げてください 効果が確認できない場合は 激化します 貯蓄が微不足んでいるなら 基調を保持する Sidewisp は現在プライベートプレビュー段階です。 トークン利用と推定コストの情報が計画されていますが その能力は今日出荷されていません 運営規則は独立して実行できます:予算が提案し,検証された結果が決定します.