TAPS 调度器:递归推理按进度-波动自适应调步长,提速 1.56 倍
Boyuan Wang · hf · 2026-10-01
循环推理(recurrent reasoning)模型通过共享参数迭代更新来扩展测试时计算,但每个学习更新的尺度固定:更新持续有进展时过于保守、波动时又过于激进。论文 TAPS 针对这一问题提出解决方案:
- 理论分析:终端损失对循环更新尺度的敏感度可精确分解为"持续进展"与"中心化波动"两部分贡献的时间平均
- 方法:TAPS(Trajectory Adaptive Progress-Fluctuation Scheduler)在线追踪两者平衡,自适应调整步长;给出了 TAPS 降低期望终端损失、以更少循环达到目标质量的充分条件
- 实验:无需重训即可提升结构化推理任务的终端准确率;若进一步把进度-波动原则纳入训练,在同等基线准确率下最多获得 1.56 倍墙钟加速
结论:更新尺度是与架构、深度并列的递归推理控制轴,适用于多种递归架构与推理策略。
「研究」频道最新
- 284个真实bug基准:AI审查agent抓出93%问题,成本降63% — jiayq · 2026-10-01
- RICE:零训练把 LLM 变成高效稠密检索器 — CShorten30 · 2026-10-01
- 新成像模态功能超声科普:原理与计算改进路径 — patrickmineault · 2026-10-01
- 功能超声脑成像从零讲起:分辨率高 fMRI 十倍且更便宜 — patrickmineault · 2026-10-01
- Nature 社论:AI 医疗器械亟需真实世界环境下的严格测试 — EricTopol · 2026-10-01
- 大脑皮层发现螺旋涡状行波,脑波远比平面波复杂 — JosephJacks_ · 2026-10-01