TRAAC 论文:按难度自适应分配思维预算,治推理模型过度思考
EliasEskin · x · 2026-10-06
- 问题:推理模型存在「欠适应」——难题上欠思考提前终止导致出错,简单题上过度思考浪费 token。
- 方法:TRAAC 通过难度校准(动态分配思维预算)+ 基于注意力的压缩(剪除冗余推理步骤),在线自适应地平衡思考量。
- 结果:在 AIME、AMC、GPQA-Diamond、BBEH 等任务上,基于 Qwen3-4B 的 TRAAC 平均绝对准确率提升,同时降低测试时计算开销。
- 论文已被 COLM 2026 接收,10 月 6 日海报展示,代码已开源。作者来自 UNC、AI2 等机构。
「研究」频道最新
- 新论文解析多模态 MoE 专家内部结构,用于大幅加速模型适配 — georgiagkioxari · 2026-10-06
- FOVEATED 框架修复知识编辑缺陷,5 种编辑器一致提升原子事实召回 — Ding Wu · 2026-10-06
- 软件在环自监督:从现有科学软件批量生成终端 agent 训练环境 — Zhongzhi Li · 2026-10-06
- CC-Bench 登陆 COLM 2026:LLM 难以适应隐式文化偏好,仍依赖刻板印象 — MaartenSap · 2026-10-06
- UCLA 博士用 LLM agent 63 天产出 12.6 万行 Lean 4 机检证明 — siyan_zhao · 2026-10-06
- Opus 5.5 智能体发现两种室温磁性半导体候选材料 — outlier99 · 2026-10-06