TAPS 调度器:递归推理按进度-波动自适应调步长,提速 1.56 倍

Boyuan Wang · hf · 2026-10-01

循环推理(recurrent reasoning)模型通过共享参数迭代更新来扩展测试时计算,但每个学习更新的尺度固定:更新持续有进展时过于保守、波动时又过于激进。论文 TAPS 针对这一问题提出解决方案:

结论:更新尺度是与架构、深度并列的递归推理控制轴,适用于多种递归架构与推理策略。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →