2026-08-01T07:43:55.976Z
LLM Razonamiento: añadir una puerta de calidad
Transformar el presupuesto dinámico de tokens de TALE en una política de liberación que ahorra tokens de razonamiento solo cuando sobrevivan los resultados de calidad y verificados.
El razonamiento LLM con conocimiento del presupuesto de tokens debe funcionar como un presupuesto estimado más una puerta de liberación, no como una instrucción dura para pensar menos. El presupuesto propone cuánto razonamiento gastar. Una verificación separada decide si la duración más corta es exacta, si el presupuesto solicitado se ha seguido de manera significativa y si el agente ha producido el resultado previsto. Esta distinción es la útil lección operativa en el documento Conocimiento de los Token Budget LLM Razonamiento, los resultados de ACL 2025, detrás de TALE. El periódico informa grandes reducciones en los tokens de salida con una pequeña compensación de precisión media. También documenta un hecho menos conveniente: un presupuesto requerido más ajustado puede producir más tokens que un moderado. Por lo tanto, un operador necesita cuatro posibles siguientes movimientos para promover, ampliar, reestimar o aumentar, sin un límite fijo. Lea TALE como un estimador, no un limitador TALE tiene dos implementaciones. TALE EP estima un presupuesto para cada pregunta, añade ese presupuesto a la solicitud de razonamiento y luego pide a la modelo la respuesta. TALE PT genera objetivos de capacitación basados en el presupuesto y internaliza el comportamiento a través de la formación posterior. El público Repositorio TALE hace que la secuencia TALE EP sea especialmente clara: su guión de referencia envía una consulta para estimar el presupuesto y una segunda consulta para producir la respuesta, luego evalúa el resultado. En la comparación detallada TALE EP del documento, la precisión media de la cadena de pensamiento de vainilla alcanzó el 83,75% con 461,25 tokens de salida por muestra. TALE EP alcanzó el 81,03% mientras utilizaba el 32% de los tokens de salida de vainilla y el 41% de sus gastos medidos. El documento también informa de una reducción promedio de 68.64% de los tokens de salida en esa comparación. Esos números son evidencia de un método, no una promesa de nivel de servicio. Se derivan de la configuración de referencia, modelos, instrucciones y evaluadores de los autores. Su carga de trabajo puede incluir efectos de herramienta, recuperación, permisos o un producto cuya exactitud no se puede reducir a una respuesta matemática exacta. La consulta adicional del estimador también pertenece al libro mayor de costos y latencia incluso cuando la segunda respuesta más corta domina el ahorro. El defecto correcto sigue siendo práctico: estimar un presupuesto por clase de tareas, probarlo contra una línea de base y mantenerlo solo cuando pase el predicado del mismo resultado. No copies un porcentaje en la producción y llamas el trabajo hecho. Esperar la elasticidad del símbolo antes de establecer la puerta Un presupuesto de tokens solicitado no es necesariamente la longitud de salida real del modelo. El papel arXiv v5 da un claro ejemplo de GPT 4o mini: Modo de razonamiento Presupuesto solicitado Tokens de salida reales Respuesta : : Cadenas de pensamiento de vainilla No hay nada 258 correcto Presupuesto informado 50 86 correcto Presupuesto informado 10 157 correcto La solicitud de 50 tokens produjo 86 tokens, sin embargo redujo la línea de base en dos tercios y conservó la respuesta. Una puerta actual <= requested literal descartaría a ese candidato útil. La solicitud de 10 tokens fue peor: produjo 157 tokens, casi el doble de la salida de la solicitud más generosa. El periódico llama a esta elasticidad simbólica. Esto cambia la política operativa de dos maneras. En primer lugar, el cumplimiento del presupuesto requiere un envase declarado. La fijación de ejemplo a continuación permite una producción real de hasta el doble del presupuesto solicitado, pero aún así requiere un ahorro de al menos un 20% en comparación con el nivel de referencia. Esos son valores de política deliberadamente inspectables, no constantes universales. En segundo lugar, una invasión extrema necesita su propio diagnóstico. No demuestra que la respuesta sea incorrecta. Dice que el estimador o la restricción de prompt no controlaron la longitud, por lo que la siguiente acción es reestimar en lugar de bajar silenciosamente el número de nuevo. La búsqueda de presupuesto óptimo del documento se basa en una aproximación de monotonicidad suave, y informa que el 90,91% de una muestra GSM8K la siguió. Temas blandas: los casos restantes son una razón para medir tokens reales, no una invitación a asumir la curva. Poner la verificación de resultados antes que el ahorro La puerta de liberación debe combinar cuatro preguntas independientes: 1. ahorro de material: ¿Se redujo el rendimiento real lo suficiente como para justificar un cambio de política? 2. Cumplimiento del presupuesto: ¿El modelo permaneció dentro del envase de la infracción permitido? 3. Calidad de tolerancia: ¿Se mantuvo un evaluador exacto, suite de regresión o puntaje limitado por encima del piso de liberación? 4. O recibo de resultados: ¿El artefacto final o el efecto externo coincidieron con lo que se pidió al agente que produjera? El cuarto control supera a los demás. Una respuesta puede ser concisa, obtener un buen puntaje en una rubrica local, y aún así no enviar el mensaje, actualizar el registro o crear el archivo esperado. Para los agentes que utilizan herramientas, almacene un identificador de destino, estado de efecto y resultado de verificación junto al registro de token. No almacenes texto oculto de razonamiento sólo para implementar esta puerta. Una función de decisión compacta puede permanecer determinista: La orden es intencional. Un efecto secundario no verificable va a una persona. Un recibo fallido o una pérdida excesiva de calidad obtiene más espacio para razonar. Una grave sobrecarga presupuestaria desencadena una nueva estimación. Un ahorro correcto pero inmaterial deja la línea de base sola. Sólo el candidato restante es ascendido. Ejecutar la fijación de promoción de seis casos Antes de conectar la regla a los agentes en vivo, prueba la póliza misma. El dispositivo utilizado para este artículo abarca seis estados inconvenientes: El caso El ahorro Prueba de resultados Decisión de la Comisión : Limitación y verificación 67.9% aprobado promueve Barata pero equivocada 76.8% no se ha logrado ampliación del presupuesto Superado elástico útil 66.7% aprobado promueve Presupuesto ignorado 39.2% aprobado reestimar el presupuesto Efecto secundario no verificable 59.4% no está disponible Escalado No se ahorrará material 11.0% aprobado Mantener la línea de base El caso de elasticidad útil utiliza la línea de base de 258 tokens del papel, la solicitud de 50 tokens y la salida real de 86 tokens. El caso de presupuesto ignorado utiliza la misma línea de base con la solicitud de 10 tokens y la salida de 157 tokens. Es por eso que el cumplimiento es una relación y por qué la reevaluación es diferente de la ampliación para la calidad. Se puede reproducir el clasificador con un dispositivo JSON que contenga baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore y candidate.verifiedOutcome . Ejecutar la función de decisión para cada fila y fallar en la prueba de política si la acción computada difiere de la acción esperada. La fijación del artículo pasó los seis casos. El primer experimento de producción debería ser pequeño: elegir una clase de tareas repetibles con un resultado determinista; recoger una línea de base a lo largo de suficientes carreras para ver la variación normal; añadir el coste estimador al mismo libro mayor; dos o tres bandas presupuestarias de ensayo en lugar de un número frágil; comparar los recibos de calidad y resultados antes de comparar dinero; promover sólo la banda que sobreviva a la puerta de liberación; mantener un retroceso automático a la política de referencia. No comience con un flujo de trabajo irreversible. Un lote de resumen con respuestas de referencia es más seguro que un agente que publica, paga, elimina o cambia permisos. Cuando el resultado es subjetivo, muestra la revisión humana y registra el desacuerdo en lugar de convertir la incertidumbre en un falso pase. Mantenga el límite del papel unido a la conclusión La evaluación principal del documento se centra en las tareas de texto, incluidas GSM8K, GSM8K Zero y MathBench, y su sección de limitaciones dice que la salida multimodal no está cubierta. También mide los tokens de salida promedio y la precisión de la tarea en su propia configuración. Los tokens ocultos de razonamiento, la contabilidad específica del proveedor, las lecturas de caché, los esquemas de herramientas y la entrada de estimador pueden cambiar la factura que ves en otros lugares. La aplicación de referencia es el código de investigación. Su script TALE EP fijado ilustra el flujo de dos consultas y los conjuntos de datos soportados, pero incluye suposiciones locales y configuración de la clave de colocación. Trata de ello como una metodología inspectable, no como un paquete de producción que funcione sin cambios. Para la salud de los agentes, la conclusión defendible es más estrecha que un razonamiento más corto es mejor. Un presupuesto es útil cuando reduce los residuos medidos y el trabajo sigue siendo correcto, completo y verificable. Si el modelo ignora el presupuesto, reestime. Si la calidad disminuye, amplíquelo. Si el efecto no se puede verificar, intensificar. Si los ahorros son triviales, manténgase en la línea de base. Sidewisp se encuentra actualmente en versión preliminar privada. Se planea el uso de tokens y la inteligencia estimada de costos, pero esa capacidad no se envía hoy. La regla de funcionamiento aquí puede aplicarse de forma independiente: que el presupuesto proponga; que el resultado verificado decida.