PlaidQ 连续扩散 LM 蒸馏至单步,HumanEval 一步达 pass@1 7.07

AlexanderTong7 · x · 2026-09-08

arXiv 论文提出 PlaidQ:一个 0.7B 的连续扩散语言模型,专用于少步/单步代码生成。方法是把预训练自回归模型改造成对连续 token embedding 的双向去噪器,再用分布匹配蒸馏实现少步生成、用成对轨迹监督实现单步生成。

关键结果:

作者认为连续扩散不只是另一种语言表示,而是少步/单步生成的可行路径。论文与代码均已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →