ICML 2026论文SAS:优化扩散语言模型的思维调度

ICML 2026 接收了一篇关于扩散语言模型推理优化的论文《Scheduling Thoughts》,并将在首尔的海报环节展示。该研究提出了一种名为自感知调度(SAS)的方法,指出大语言模型推理的下一个突破口可能不在于生成更长的思维链,而在于“调度思维”。

背景与核心思想

传统自回归语言模型天生受限于从左到右的串行生成,而扩散语言模型从掩码文本出发,迭代揭开 token,赋予了思维出现顺序的自由。研究者指出,扩散模型解码的关键不是能否并行,而是“能否学会在何时做出承诺”。现有的手工解码调度(如基于置信度或从左到右)往往短视,只关注当前哪个 token 容易确定;而过早揭开错误 token 会锁定坏约束。为此,SAS 引入了一个轻量级的自感知调度器,在保持底层语言模型冻结的情况下,利用模型自身的路径似然作为奖励,学习一种由易到难的原生解题课程。

关键细节与实验收益

SAS 将解码顺序转化为可训练的推理策略,类似于无需人工轨迹的过程监督。在数独任务上,这种“先传播约束再处理模糊格子”的调度策略表现直观:相比最佳启发式的 82.0% 准确率,SAS 达到 91.8%,加上第二阶段微调后更是提升至 97.5%。此外,这种收益可迁移至其他任务,在 LLaDA-8B 模型上,GSM8K pass@1 从 64% 提升至 76%,MBPP pass@1 从 39.5% 提升至 41%,且在不同生成长度和解码设置下保持稳健。

影响与启示

一个值得注意的意外发现是,人类的逻辑顺序并不总是对模型最优。预训练的扩散语言模型可能沿着不同于人类解题轨迹的路径能达到更好效果。这表明,未来模型推理的探索方向不应仅局限于模仿人类的类人 CoT,而应转向寻找“模型感知”的思维排序。

2026-07-06 ~ 2026-07-07 · 15 条相关

一手来源