2026-08-01T07:44:00.609Z

代币-预算-了解 LLM 推理:添加质量门

转换TALE的动态代币预算成为一个释放政策,只有在质量和验证结果存活时,才可以保存推理代币.

预计预算的LLM推理应作为预估预算加上释放门,而不是作为一个硬的指令, 单独的检查决定了更短的运行是否准确,要求的预算是否得到了合理的遵守,以及代理是否产生了预期的结果. 这种区别是标记 预算 了解 LLM 推理中有用的运营教训,这是TALE背后的ACL 2025论文的发现. 报道称,输出代币大幅减少,平均准确度较小. 它还证实了一个不那么方便的事实:要求更严格的预算可以产生比中度的代币更多的代币. 因此,一个运营商需要四个可能的下一步举动推广,扩大,重新估计或升级没有一个固定限额. 阅读TALE作为一个估计者,而不是一个限制者 TALE有两种实施方式. TALE EP估计每个问题的预算,将该预算添加到推理提示中,然后要求模型回答. 通过后培训,TALE PT产生了预算意识的培训目标,并内部化了这种行为. 公共数字库使TALE EP序列特别清楚:其参考脚本发送一个查询来估计预算,第二个查询来生成答案,然后评估结果. 在论文详细的TALE EP比较中,瓦尼莉思维链平均准确度达到83.75%,每个样本的输出代币为461.25. 在使用32%的尼拉输出代币和41%的测量费用时,TALE EP达到81.03%. 该报还报告了该比较中平均68.64%的输出标志减少. 这些数字证明了一种方法,而不是服务水平的承诺. 它们来自作者的基准配置,模型,提示和评估者. 您的工作负载可能包括工具效果,检索,权限,或者一个不能将其正确性降低到一个精确的数学答案. 估计器的额外查询也属于成本和延迟账本,即使较短的第二响应主导了节省. 正确的默认仍然是实用的:估计每个任务类的预算,与基线进行测试,并且只有当相同的结果预测通过时保留它. 不要把百分比复制成生产,把工作做完了. 在设置门之前,预计标志性弹性 要求的代币预算不一定是模型的实际输出长度. 对于文件 arXiv v5,GPT 4o mini提供了一个明确的例子: 推理方式 要求的预算 实际输出代币 答案 : : 瓦尼拉的思想链 没有 258 正确的 预算意识的快速 50 86 正确的 预算意识的快速 10 157 正确的 要求50个代币产生了86个代币,但它削减了三分之二的基线并保留了答案. 一个字面上的 actual <= requested 门会抛弃那个有用的候选人. 要求10个代币的情况更糟:它产生了157个代币,几乎是更慷慨的请求的两倍. 报纸称这是一种象征性弹性. 这将以两种方式改变运营政策. 首先,预算遵守需要声明的包裹. 下面的示例设置允许实际产量高达所需预算的两倍,但仍然需要至少20%的节省. 这些是可故意检查的政策价值,而不是普遍的常数. 第二,一个极端的侵袭需要自己的诊断. 这并不证明答案是错误的. 它说估计器或提示限制未能控制长度,所以下一步的行动是重新估计,而不是默默降低数字. 该论文的最佳预算搜索依赖于柔软的单调性近似性,报告说,GSM8K样本中的90.91%遵循了它. 软问题:剩余的案例是衡量实际代币的理由,而不是邀请假设曲线. 在储蓄之前,先进行结果验证 释放门应该结合四个独立的问题: 1. 材料节省: 实际产量下降足以证明政策改变? 2. 预算遵守: 车型是否保持在被允许过境包裹内? 3. 质量耐受性: 确切的评估器,回归套件或有限的分数是否保持在释放层以上? 4. O 收益收据: 最终的文物或外部效果是否与代理要求制造的相匹配? 第四个检查比其他人更高. 答案可能简单,在本地分类上得分很好,但仍然无法发送消息,更新记录或创建预期的文件. 对于使用工具的代理,将目的地识别符,效果状态和验证结果存储在代币记录旁边. 不要保存隐藏的推理文本,只是为了实现这个门口. 一个紧的决策函数可以保持确定性: 命令是故意的. 一个不可验证的副作用会发生在一个人身上. 如果收到的收据失败或过度降低质量, 严重的预算过度导致重新估算. 一个正确但无关紧要的储蓄只剩下基线. 只有剩下的候选人才会升职. 运行六个案例的促销装置 在将规则连接到现场代理之前, 这篇文章的设置包括六种不方便的情况: 案例 储蓄 结果证据 决策 : 限制和验证 67.9% 通过 促进 廉价,但错误 76.8% 失败 扩大预算 有效的弹性过 66.7% 通过 促进 预算被忽视 39.2% 通过 重新估计预算 无法验证的副作用 59.4% 无法使用 升级 没有材料节省 11.0% 通过 保持基线 使用性弹性案例采用纸张的258个代币基线,50个代币请求和86个代币实际输出. 预算被忽视的案例使用了10个代币请求和157个代币输出的相同基线. 这就是为什么合规性是一个比率,所以重新估计与质量扩大不同. 您可以用一个 JSON 含有 baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore 并且 candidate.verifiedOutcome . 运行每个行的决策函数,如果计算的操作与预期的操作不同,则失败政策测试. 这项文件通过了所有六起案件. 第一次生产实验仍然应该是小的: 选择一个具有确定性结果的可重复任务类; 收集一个足够的运行线的基线,以查看正常差异; 将估计成本添加到同一个账本中; 试用两个或三个预算带,而不是一个脆弱的数字; 在比较货币之前,比较质量和结果收据; 仅推广存活释放门的乐队; 保持自动回归基线政策. 不要从一个不可逆转的工作流程开始. 总结一批引用答案比发布,支付,删除或更改权限的代理更安全. 当结果是主观的时, 取样人类的审查和记录不同意度, 而不是把不确定性转化为虚假的通过. 保持论文的边界与结论相连 该论文的主要评估集中在包括GSM8K,GSM8K Zero和MathBench在内的文本任务上. 它还根据自己的设置测量平均输出代币和任务精度. 隐藏的推理代币,供应商特定的会计,缓存阅读,工具方案和估计器输入可能会改变你在其他地方看到的账单. 参考实施是研究代码. 它的固定的TALE EP脚本说明了两个查询流程和支持的数据集,但它包括本地假设和位置持有钥匙配置. 把它视为可检查的方法,而不是一个不变的生产包. 对于代理人的健康,可辩护的结论比较狭窄,而较短的推理更好. 如果模型忽略了预算,重新估计. 如果质量下降,扩大. 如果效果无法验证, 如果储蓄是微不足道的, Sidewisp 目前处于私密预览阶段。 预计将使用代币和估计成本的情报, 在这里,运营规则可以独立执行:让预算提出建议,让经过验证的结果决定.