微软 When2Think:AIME24 Pass@3 提升 10%,token 用量省 27.9%
microsoft · hf · 2026-09-18
微软提出 When2Think,一个针对混合推理模型的后训练框架,解决大推理模型「简单题想太多、难题想不够」的系统性低效。
- 思路:把高效推理建模为按题目难度实例自适应分配算力的问题,学习何时用 System 1(直接作答)vs System 2(扩展推理)
- 方法:核心是 Instance-level Difficulty-Aware Control(IDAC)奖励塑形,利用预计算的准确率与 token 用量参考统计来调节推理深度;配合验证器奖励与批内标准化优势,无需学习奖励模型或在线参考模型查询即可稳定实现 critic-free 优化
- 结果:AIME24 上 Pass@3 提升 10.0%、token 用量减少 27.9%;AIME25 上达 40.0% Pass@3,超过压缩类和纯路由类基线
「研究」频道最新
- 机器学习告别炼金术时代:研究将走向可证伪的证据科学 — mike64_t · 2026-09-18
- Together AI 提出分数中心化,修正 RL 训练-推理失配漂移 — PandaAshwinee · 2026-09-18
- Cell 推出 AI 生物学特刊,封面是抗衰老基准 LongevityBench — JosephJacks_ · 2026-09-18
- OpenAI 攻克 Navier-Stokes 后:人类数学家时代正在终结 — yeastsplainer · 2026-09-18
- 团队自研 BB-SLAM:纯视觉里程计 6 个月做出 2 厘米精度地图 — broodsugar · 2026-09-18
- AI4Science 现超预期突破,计算化学工作将大幅提速 — BenBlaiszik · 2026-09-18