PlaidQ 连续扩散 LM 蒸馏至单步,HumanEval 一步达 pass@1 7.07
AlexanderTong7 · x · 2026-09-08
arXiv 论文提出 PlaidQ:一个 0.7B 的连续扩散语言模型,专用于少步/单步代码生成。方法是把预训练自回归模型改造成对连续 token embedding 的双向去噪器,再用分布匹配蒸馏实现少步生成、用成对轨迹监督实现单步生成。
关键结果:
- 匹配模型规模下,PlaidQ 与离散扩散 LM 在代码生成上竞争力相当
- 蒸馏显著移动质量-算力前沿:16 步学生在 HumanEval 达 31.78、MBPP+ 达 40.49 pass@10,超过同一教师模型采样 512 步的成绩
- 成对轨迹蒸馏把生成压缩到单步去噪,HumanEval pass@1 达 7.07,仍能产出功能正确的程序
作者认为连续扩散不只是另一种语言表示,而是少步/单步生成的可行路径。论文与代码均已开源。
「研究」频道最新
- NVIDIA VoLo 入选 CoRL 2026,VLM 当大脑编排机器人长程操作 — erwincoumans · 2026-09-08
- BMVA 世界模型研讨会 11 月伦敦举行,DeepMind 等嘉宾出席 — CSProfKGD · 2026-09-08
- 用任务条件吸引子解释迭代推理:模型泛化而非死记的机制研究 — burkov · 2026-09-08
- 通用编码Agent胜专用数据Agent达37分,论文追问系统研究还剩什么 — CShorten30 · 2026-09-08
- Gemini Pro 跑研究任务近 5 小时几乎无进展,仍被看好 — teortaxesTex · 2026-09-08
- Astra 试图纯计算复现 EUV 散射论文数据,失败收场 — teortaxesTex · 2026-09-08