2026-08-01T07:43:56.657Z
Token-Budget-Aware LLM Raciocínio: Adicionar um Portal de Qualidade
Transforme o orçamento dinâmico de tokens da TALE em uma política de liberação que salva tokens de raciocínio apenas quando os resultados de qualidade e verificados sobrevivem.
O raciocínio LLM, consciente do orçamento de tokens, deve ser operado como um orçamento estimado mais um portal de liberação, não como uma instrução dura para pensar menos. O orçamento propõe quanto raciocínio gastar. Uma verificação separada decide se o período mais curto é preciso, se o orçamento solicitado foi seguido de forma significativa e se o agente produziu o resultado pretendido. Essa distinção é a útil lição operacional do documento Token Budget Aware LLM Raciocínio, os resultados do ACL 2025, por trás do TALE. O jornal relata grandes reduções de tokens de saída com uma pequena compensação média de precisão. Também documenta um facto menos conveniente: um orçamento mais restrito pode produzir mais tokens do que um moderado. Um operador precisa, portanto, de quatro possíveis movimentos seguintes para promover, alargar, reestimar ou aumentar nem um limite fixo. Leia TALE como um estimador, não um limitador O TALE tem duas implementações. O TALE EP estima um orçamento para cada pergunta, acrescenta esse orçamento ao pedido de raciocínio e, em seguida, pede ao modelo a resposta. O TALE PT gera metas de formação conscientes do orçamento e internaliza o comportamento através da pós formação. O público Repositório TALE torna especialmente clara a sequência TALE EP: o seu script de referência envia uma consulta para estimar o orçamento e uma segunda consulta para produzir a resposta, e depois avalia o resultado. Na comparação TALE EP detalhada do artigo, a precisão média da cadeia de pensamento de baunilha atingiu 83,75% com 461,25 tokens de saída por amostra. O TALE EP alcançou 81,03% enquanto usava 32% dos tokens de saída de baunilha e 41% das suas despesas medidas. O artigo também relata uma redução média de 68,64% dos tokens de saída nessa comparação. Esses números são evidências de um método, não de uma promessa de nível de serviço. Eles vêm da configuração, modelos, instruções e avaliadores de referência dos autores. A sua carga de trabalho pode incluir efeitos de ferramenta, recuperação, permissões ou um produto cuja correção não pode ser reduzida a uma resposta matemática exata. A consulta extra do estimador também pertence ao livro de custos e latência, mesmo quando a segunda resposta mais curta domina a poupança. O padrão correto ainda é prático: estimar um orçamento por classe de tarefas, testá lo contra uma linha de base e mantê lo apenas quando o mesmo predicado de resultado passar. Não copiar uma percentagem na produção e chamar o trabalho feito. Espere elasticidade simbólica antes de colocar o portão Um orçamento de token solicitado não é necessariamente o comprimento de saída real do modelo. O papel arXiv v5 dá um exemplo claro sobre o GPT 4o mini: Modo de raciocínio Orçamento solicitado Tokens de saída reais Resposta : : Cadeia de pensamento de vainilha Nenhum 258 Correcto Prestação de orçamento 50 86 Correcto Prestação de orçamento 10 157 Correcto O pedido de 50 tokens produziu 86 tokens, mas reduziu a linha de base em dois terços e preservou a resposta. Um portão actual <= requested literalmente descartaria esse candidato útil. O pedido de 10 tokens foi pior: produziu 157 tokens, quase o dobro da saída do pedido mais generoso. O jornal chama isso de elasticidade simbólica. Isto altera a política operacional de duas maneiras. Em primeiro lugar, a conformidade com o orçamento requer um envelope declarado. O exemplo abaixo permite uma produção efetiva até ao dobro do orçamento solicitado, mas ainda exige uma economia de pelo menos 20% em relação ao valor de base. Estes são valores de política deliberadamente inspeccionáveis, não constantes universais. Em segundo lugar, uma invasão extrema precisa de um diagnóstico próprio. Não prova que a resposta seja errada. Diz que o estimador ou a restrição de prompt não conseguiu controlar o comprimento, então a próxima ação é reestimar em vez de reduzir silenciosamente o número novamente. A pesquisa de orçamento ideal do artigo baseia se em uma aproximação de monotonicidade suave, e relata que 90,91% de uma amostra GSM8K seguiu o. Matéria suave: os casos restantes são uma razão para medir tokens reais, não um convite para assumir a curva. Colocar a verificação dos resultados antes da poupança O portal de liberação deve combinar quatro questões independentes: 1. A economia de material: A produção real caiu o suficiente para justificar uma mudança de política? 2. Conformidade com o orçamento: O modelo permaneceu dentro do envelope de sobrecarga permitido? 3. Tolerância de qualidade: Um avaliador exato, suíte de regressão ou pontuação limitada permaneceram acima do piso de liberação? 4. O receita de resultado: O artefacto final ou o efeito externo coincidem com o que foi solicitado ao agente para produzir? O quarto check supera os outros. Uma resposta pode ser concisa, obter uma boa pontuação em uma rubrica local, e ainda não enviar a mensagem, atualizar o registro ou criar o arquivo esperado. Para agentes que usam ferramentas, armazenar um identificador de destino, status de efeito e resultado de verificação ao lado do registro do token. Não armazenar texto de raciocínio oculto apenas para implementar este portal. Uma função de decisão compacta pode permanecer determinista: A ordem é intencional. Um efeito colateral não verificável vai para uma pessoa. Um recibo falhado ou uma queda excessiva de qualidade dá mais espaço para raciocínio. Um grave excesso de orçamento desencadeia uma reavaliação. Uma poupança correta, mas imaterial, deixa a linha de base sozinha. Só o candidato restante é promovido. Execute o sistema de promoção de seis casos Antes de ligar a regra aos agentes vivos, teste a própria política. O dispositivo utilizado para este artigo abrange seis estados inconvenientes: Caso Salvamento Evidências de resultados Decisão : Limitados e verificados 67.9% aprovado promover Barata, mas errada. 76.8% falhou alargar o orçamento Superamento elástico útil 66.7% aprovado promover Orçamento ignorado 39.2% aprovado reestimar o orçamento Efeito secundário não verificável 59.4% Não disponível Escalada Sem poupança de material 11.0% aprovado manter a linha de base O caso de elasticidade útil usa a linha de base de 258 tokens do papel, a solicitação de 50 tokens e a saída real de 86 tokens. O caso de orçamento ignorado usa a mesma linha de base com o pedido de 10 tokens e a saída de 157 tokens. É por isso que a conformidade é uma relação e que a reavaliação é diferente do alargamento para a qualidade. Pode se reproduzir o classificador com uma fixação JSON contendo baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore e candidate.verifiedOutcome . Execute a função de decisão para cada linha e falhe no teste de política se a ação computada for diferente da ação esperada. A fixação do artigo passou por todos os seis casos. A primeira experiência de produção deve ser ainda pequena: Selecionar uma classe de tarefas repetíveis com um resultado determinista; Recolher uma linha de base através de corridas suficientes para ver a variância normal; Adicionar o custo estimador ao mesmo livro razão; duas ou três bandas de orçamento de ensaio, em vez de um número frágil; Comparar as receitas de qualidade e de resultado antes de comparar o dinheiro; promover apenas a banda que sobreviva ao portal de liberação; manter um retrocesso automático à política de referência. Não comece com um fluxo de trabalho irreversível. Um lote de resumo com respostas de referência é mais seguro do que um agente que publica, paga, elimina ou muda permissões. Quando o resultado for subjetivo, mostre uma revisão humana e registre a desacordo em vez de converter a incerteza em uma passagem falsa. Mantenha o limite do papel ligado à conclusão A avaliação principal do artigo centra se em tarefas de texto, incluindo GSM8K, GSM8K Zero e MathBench, e sua seção de limitações diz que a saída multimodal não é coberta. Também mede os tokens de saída médios e a precisão da tarefa sob a sua própria configuração. Tokens de raciocínio ocultos, contabilidade específica do fornecedor, leituras de cache, esquemas de ferramentas e entrada estimadora podem alterar a conta que você vê em outros lugares. A aplicação de referência é o código de investigação. Seu script TALE EP afixado ilustra o fluxo de duas consultas e conjuntos de dados suportados, mas inclui suposições locais e configuração de chave de colocação. Trate o como uma metodologia inspecionável, não como um pacote de produção que funcione inalterado. Para a saúde dos agentes, a conclusão defensiva é mais estreita do que o raciocínio mais curto é melhor. Um orçamento é útil quando reduz o desperdício medido e o trabalho permanece correto, completo e verificável. Se o modelo ignorar o orçamento, reestimar. Se a qualidade cair, amplia a. Se o efeito não puder ser verificado, intensifique. Se as poupanças forem triviais, mantenha a linha de base. A Sidewisp está atualmente em prévia privada. O uso de tokens e a inteligência estimada de custos estão planejados, mas essa capacidade não é enviada hoje. A regra operacional pode ser aplicada de forma independente: deixe o orçamento propor; deixe o resultado verificado decidir.