KAIST 提出 Pivot-SD:只蒸馏关键去噪决策,200 题超越强化学习基线
kaist-ai · hf · 2026-10-05
掩码扩散语言模型(dLM)在并行推理中去噪时的少数关键「承诺」会大幅决定后续走向,但现有后训练方法要么训练整段文本、要么奖励整个去噪步,浪费了这一信号。KAIST AI 团队提出 Pivot-SD 框架:用信息增益度量识别这些高影响力的 pivot,成功轨迹用交叉熵、失败轨迹用针对性 unlikelihood 监督,其余位置不动。仅需 200 道题、每题 4 次采样,Pivot-SD 在数学与代码基准上让 LLaDA-8B-Instruct 超过全序列 SFT 和算力对齐的扩散 RL 基线。
「研究」频道最新
- 上海交大发布 LIFT:VLA 零力标注预训练,后训练注入力觉高频反应 — jiqizhixin · 2026-10-05
- LOOM 让循环 MoE 稳定跑到 9-12 层循环,iso-FLOP 反超标准 MoE — SonglinYang4 · 2026-10-05
- 论文被 ACML 2026 接收却因无钱交注册费考虑撤稿 — Jealous_Key_4030 · 2026-10-05
- CMU 提出 TailRL:优化奖励上尾概率,让 RL 少陷次优解 — ceciletamura · 2026-10-05
- CTWM 用一半参数持平强基线:六个像素级任务导航操作全测 — hisspikeness · 2026-10-05
- 多数自监督学习破坏所需表征缩放,论文用 log-det 正则修复 — hisspikeness · 2026-10-05