2026-08-01T07:44:02.033Z

토큰 예산 인식 LLM 추론: 품질 게이트를 추가

TALE의 역동적인 토큰 예산은 품질과 검증된 결과물이 생존할 때만 논리 토큰을 저장하는 출시 정책으로 전환하십시오.

토큰 예산에 대한 LLM 추론은 예상 예산과 방출 관문으로 운영되어야 하며, 덜 생각하기 위한 어려운 명령으로 운영되어야 한다. 예산은 얼마나 많은 추론을 지출해야 하는지를 제안한다. 별도의 검사는 짧은 운행이 정확하는지, 요청된 예산이 의미있게 준수되었는지, 그리고 대리인이 의도된 결과를 얻었는지 여부를 결정합니다. 이러한 구별은 TALE의 뒷받침인 ACL 2025의 연구결과인 토큰 예산 지식 LLM 논리의 유용한 운영 교훈입니다. 이 논문은 평균 정확성 간소화와 큰 출력 토큰 감소에 대해 보고합니다. 또한 덜 편리한 사실을 기록합니다. 더 엄격한 요구된 예산은 중소적인 것보다 더 많은 토큰을 생산할 수 있습니다. 따라서 사업자는 4가지 가능한 다음 동작을 필요로 합니다. TALE를 한계기보다는 추정기라고 읽으십시오. TALE는 두 가지 구현이 있습니다. TALE EP는 각 질문에 대한 예산을 추정하고, 그 예산을 논의를 요청하는 데 추가하고, 그 다음 모델에게 답을 요청합니다. TALE PT는 예산에 대한 교육 목표를 생성하고 교육 후 과정을 통해 행동을 내부화합니다. 공개된 TALE 저장소는 TALE EP 순서를 특히 명확하게 보여준다. 그 참조 스크립트는 예산을 추정하기 위해 한 가지 질의를 보내고, 그 다음 결과를 평가하기 위해 두 번째 질의를 보내고, 그 다음 답변을 제공합니다. 논문의 상세한 TALE EP 비교에서 바닐라 사슬의 사고 정확도는 샘플당 461.25개의 출력 토큰으로 평균 83.75%에 달했다. TALE EP는 바닐라 출력 토큰의 32%와 측정된 비용의 41%를 사용하면서 81.03%를 달성했습니다. 이 논문은 또한 그 비교에서 평균 68.64%의 출력 토큰 감소를 보고합니다. 그 숫자는 어떤 방법의 증거가 아니라 서비스 수준에 대한 약속입니다. 그들은 저자의 벤치마크 구성, 모델, 명령어 및 평가자로부터 왔습니다. 작업 부하에는 도구 효과, 검색, 권한 또는 정확한 수학 답으로 줄일 수 없는 결과물이 포함될 수 있습니다. 추산자의 추가 조사는 더 짧은 두 번째 응답이 저축을 지배하는 경우에도 비용 및 지연 리더에 포함됩니다. 올바른 기본은 여전히 실용적입니다. 작업 클래스당 예산을 추정하고 기본 라인에 대해 테스트하고 동일한 결과 예측이 통과되면만 유지하십시오. 생산에 비율을 복사하지 말고 작업을 완료한다고 말하십시오. 게이트를 설정하기 전에 토큰 탄력성을 기대합니다. 요청된 토큰 예산은 반드시 모델의 실제 출력 길이가 아닙니다. arXiv v5 종이는 GPT 4o mini에 대한 날카로운 예를 제공합니다: 추론 방식 요청된 예산 실제 출력 토큰 대답 : : 바닐라 사상 연쇄 아무 것도 없습니다. 258 정확함 예산을 알 수 있는 시급 50 86 정확함 예산을 알 수 있는 시급 10 157 정확함 50개의 토큰 요청은 86개의 토큰을 생산했지만, 그 기준을 2/3로 줄여서 답을 보존했습니다. 문자 그대로 actual <= requested 게이트는 그 유용한 후보를 버립니다. 10개의 토큰 요청은 더 나쁘게 되었는데 157개의 토큰을 생산했는데 이는 더 관대한 요청의 거의 두 배나 더 많았습니다. 이 논문은 이것을 상징적인 탄력성이라고 부릅니다. 이것은 두 가지 방법으로 운영 정책을 변경합니다. 첫째, 예산의 준수에는 선언된 봉투가 필요합니다. 아래의 예제 장치는 요청된 예산의 2배까지의 실제 출력을 허용하지만 여전히 기본 기준에 비해 최소 20%의 저축이 필요합니다. 이것들은 의도적으로 검사할 수 있는 정책 가치이고, 보편적인 일정도 아닙니다. 둘째, 극단적인 침략은 스스로 진단해야 합니다. 그 답이 틀렸다는 증거가 아닙니다. 계산기 또는 프롬프트 제약이 길이를 제어하지 못했기 때문에 다음 작업은 다시 계산하는 것이므로 침묵으로 다시 숫자를 낮추는 것이 아닙니다. 논문의 최적 예산 검색은 부드러운 단조성 근접에 의존하고 있으며 GSM8K 샘플의 90.91%가 그것을 따랐다고 보고합니다. soft 문제: 나머지 경우들은 실제 토큰을 측정하는 이유가 아니라 곡선을 추측하는 초대입니다. 저축보다 먼저 결과 확인을 해야 합니다. 방출 게이트는 네 가지 독립적인 질문을 합쳐야 합니다. 1. 물질 절약: 정책 변경을 정당화하기 위해 실제 생산량이 떨어졌습니까? 2. 예산 준수: 모델은 허용된 범행 봉투 안에 남아 있습니까? 3. 품질 용납성: 정확한 평가자, 회귀 제품군 또는 제한된 점수는 방출 층 이상으로 유지되었습니까? 4. O 출제 영수증: 최종 유물 또는 외부 효과는 대리인이 생산하도록 요청한 것과 일치했습니까? 네 번째 검사는 다른 사람들을 능가합니다. 답변은 간결하고, 지역 항목에 좋은 점수를 얻을 수 있지만 여전히 메시지를 보내지거나 기록을 업데이트하거나 예상된 파일을 만들 수 없습니다. 도구를 사용하는 에이전트에서는 도켓 기록 옆에 목적지 식별자, 효과 상태 및 검증 결과를 저장합니다. 이 게이트를 구현하기 위해 숨겨진 논리 텍스트를 저장하지 마십시오. 콤팩트 결정 함수는 결정적일 수 있습니다: 명령은 의도적이죠. 검증되지 않는 부작용은 사람에게 발생합니다. 실패한 영수증이나 과도한 품질 하락은 더 많은 논의를 할 수 있습니다. 심각한 예산 과잉은 재평가를 유발합니다. 올바른 하지만 비물질적인 저축은 기본 기준만 남깁니다. 남은 후보만 승진한다. 6개의 프로모션 팩트를 실행하세요 규칙과 라이브 에이전트를 연결하기 전에 정책 자체를 테스트하십시오. 이 기사 에 사용 된 장치 는 여섯 가지 불편 한 상태 를 다루고 있습니다. 사건 저축 결과 증거 결정 : 제한 및 검증 67.9% 통과 홍보 저렴하지만 잘못된 것 76.8% 실패 예산 확대 유용한 탄력적 압축 66.7% 통과 홍보 예산 무시 39.2% 통과 재평가 예산 검증되지 않는 부작용 59.4% 사용할 수 없습니다 격화 재료를 절약할 수 없습니다 11.0% 통과 기본 기준을 유지하세요 유틸리티 탄력성 케이스는 논문의 258 토큰 기본 라인, 50 토큰 요청 및 86 토큰 실제 출력을 사용합니다. 예산을 무시한 경우 10 토큰 요청과 157 토큰 출력과 같은 기본 라인을 사용합니다. 따라서 컴플라이언스는 비례이고 재평가가 질을 위해 확장하는 것과 다르기 때문입니다. 분류기를 JSON 기계를 사용하여 baseline.outputTokens , baseline.qualityScore , candidate.requestedBudget , candidate.outputTokens , candidate.qualityScore , candidate.verifiedOutcome 를 포함할 수 있습니다. 각 라인에 대한 결정 함수를 실행하고 계산된 동작이 예상된 동작과 다르다면 정책 테스트를 실패하십시오. 이 기사는 6건 모두 통과했습니다. 첫 번째 생산 실험은 여전히 작아야 합니다. 결정적인 결과를 가진 반복 가능한 작업 클래스를 선택하십시오. 정상 변수를 볼 수 있는 충분한 경로를 통해 기본선을 수집합니다. 같은 대책서에 추정비용을 추가하고, 1개의 부서지기 쉬운 숫자보다는 2~3개의 예산 대역을 시험한다. 돈을 비교하기 전에 품질과 결과 영수증을 비교합니다. 방출문에서 살아남은 밴드만을 홍보한다. 기본정책으로 자동으로 되돌아가야 합니다. 돌이킬 수 없는 작업 흐름으로 시작하지 마십시오. 참고 답변을 담은 요약 배트는 저작권을 게시하거나 지불하거나 삭제하거나 변경하는 에이전트보다 더 안전합니다. 결과가 주관적이면, 불확실성을 거짓으로 바꾸는 대신 인간의 검토와 의견 충돌을 기록하십시오. 논문의 한계를 결론에 붙여 두어야 합니다. 이 논문의 주요 평가는 GSM8K, GSM8K Zero, MathBench 등 텍스트 작업에 중점을 두고 있으며, 그 제한 섹션에서는 멀티모달 출력이 포함되지 않는다고 말합니다. 또한 자체 설정을 통해 평균 출력 토큰과 작업 정확도를 측정합니다. 숨겨진 추론 토큰, 공급자 특정 회계, 캐시 읽기, 도구 스키마 및 추정기 입력은 다른 곳에서 볼 수 있는 청구서를 변경할 수 있습니다. 참고 구현은 연구 코드입니다. TALE EP 스크립트는 두 개의 쿼리 흐름과 지원된 데이터 세트를 보여줍니다. 그러나 지역 가정과 위치 키 구성을 포함합니다. 검사 가능한 방법론으로 취급하고, 변함없이 작동하는 생산 패키지처럼 취급하지 마십시오. 에이전트 보건에 있어서, 방어 가능한 결론은 더 좁고 더 짧은 추론이 더 낫다. 모델이 예산을 무시한다면 재평가해 보세요. 품질이 떨어지면 더 넓혀라. 그 효과를 확인할 수 없다면, 격화시켜라. 만약 저축이 소소한 경우, 기본 기준을 유지하세요. Sidewisp는 현재 비공개 프리뷰 단계입니다. 토큰 사용과 추정 비용 정보도 계획되어 있지만, 그 능력은 오늘 발급되지 않습니다. 여기서 운영 규칙은 독립적으로 실행될 수 있습니다. 예산이 제안하도록 하고, 검증된 결과가 결정하도록 합니다.