KAIST 提出 Pivot-SD:只蒸馏关键去噪决策,200 题超越强化学习基线

kaist-ai · hf · 2026-10-05

掩码扩散语言模型(dLM)在并行推理中去噪时的少数关键「承诺」会大幅决定后续走向,但现有后训练方法要么训练整段文本、要么奖励整个去噪步,浪费了这一信号。KAIST AI 团队提出 Pivot-SD 框架:用信息增益度量识别这些高影响力的 pivot,成功轨迹用交叉熵、失败轨迹用针对性 unlikelihood 监督,其余位置不动。仅需 200 道题、每题 4 次采样,Pivot-SD 在数学与代码基准上让 LLaDA-8B-Instruct 超过全序列 SFT 和算力对齐的扩散 RL 基线。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →