ELF: Embedded Language Flows
Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
cs.CL, cs.AI, cs.LG
2026-05-12
在冻结 T5 嵌入空间做 Flow Matching,只在最后一步把连续状态解码成 token。105M 的 ELF-B 在 OWT 上 32 步生成困惑度 24.08,训练约 45B token,离散对照常用 500B 以上。
图像和视频生成已经把扩散 / 流匹配做成默认工具,语言这边领先的扩散语言模型却大多直接在离散 token 上噪声。连续路线并非没有:Diffusion-LM、CDCD、simplex 方法都试过,后面往往每一步都用交叉熵把状态拽回词表,或者再挂一个独立解码器。离散方案(MDLM、Duo)近年把连续方案压了下去,于是有一种方便的解释:语言天生离散,连续松弛是在找麻烦。
MIT 这篇(何恺明、Jacob Andreas、Yoon Kim 等)把问题收成一句:连续 DLM 弱,是不是因为离散,还是因为接口没接好。ELF 的回答是后者。去噪轨迹尽量留在连续嵌入里,离散化只发生在终点。
训练时用冻结的预训练 T5-small(35M,512 维)把句子编成上下文嵌入,再投影到 128 维瓶颈。噪声到数据走 rectified flow:zt = t x + (1-t) ε。网络预测干净嵌入 x(x-prediction),再用 (x−zt)/(1−t) 还原速度。作者强调 v-prediction 和最后一步共享权重时很差,因为速度场并不对准「预测干净 token」这件事。
最后一步 t=1 时 zt 已经贴近干净嵌入,训练必须另做一次嵌入损坏,再让同一套网络进入 decode 模式,经 unembedding 矩阵出 logits,用 token 级交叉熵。推理时前面全是 denoise 模式的 ODE/SDE 积分,只在终点切 decode、argmax。训练里约 80% 步走 MSE 去噪、20% 走交叉熵解码,一个 batch 里两支一起算。
连续速度场让分类器无关引导(CFG)几乎是平移:用 self-conditioning 的中间预测当条件,训练期 CFG 一次前向就能模拟外推,推理不再付双倍。条件生成则把干净前缀嵌在序列前面、不去噪,走自注意力。SDE 风格采样每步回注一点噪声,少步时比纯 ODE 稳。
无条件生成在 OpenWebText 上,句长 1024。ELF-B 105M,Muon 学习率 0.002,5 个 epoch 约 9.5 万步,有效训练 token 约 45.2B。对照 MDLM、Duo、FLM、LangFlow 参数大约 170M,训练 token 多在 500B 以上(图里标到 524B–577B)。评价是 GPT-2 Large 的生成困惑度加 unigram 熵,1000 条样本。
系统对比的默认设置是 SDE + self-conditioning CFG=3。32 步 Gen PPL 24.08±0.16,熵 5.15;16 步 33.66;8 步 67.32。正文写「32 步 Gen PPL 24,比先前 DLM 少很多推理步」。少步区不蒸馏也压过 MDLM+SDTT、Duo+DCD、FMLM;附录再做渐进蒸馏(ELF+PD),五轮之后 8 步 Gen PPL 23.2、1 步 136.1(熵 5.26,不再退化成复读)。
条件任务上 ELF-B 也是表内最高:
| 模型 | 参数 | WMT14 De-En BLEU | XSum R1 / R2 / RL |
| AR | 99M | 25.2 | 30.5 / 10.2 / 24.4 |
| MDLM | 99M | 18.4 | 33.4 / 11.6 / 25.8 |
| E2D2 | 99M | 24.8 | 28.4 / 8.3 / 22.0 |
| Duo | 170M+35M | 21.3 | 31.4 / 10.1 / 25.0 |
| ELF-B | 105M+35M | 26.4 | 36.0 / 12.2 / 27.8 |
消融:预训练上下文嵌入最好,从零训 T5 编码器略差,可学习非上下文嵌入最差。共享权重解码器和两阶段独立解码器 Pareto 接近,共享权重能探到更低困惑度。模型从 105M 扩到 652M,Gen PPL–熵前沿外移。CFG 降困惑度也降熵,尺度超过 3 之后多数规格开始回退。
连续 DLM 不是注定当配角。把离散化从每一步挪到终点,图像侧现成的 Flow Matching、CFG、ODE/SDE 就可以原样用上,还省掉独立解码器。数据效率是这套设计里最硬的数字:大约 45B token 打过按 500B 量级训的离散基线。
它和同期的 FLM/FMLM 走的是同一条「语言也可以连续流」的路,接口不同。FLM 用 one-hot 加 flow map 蒸馏换一步;ELF 用 T5 嵌入、共享解码,不蒸馏也能在 8–32 步打到很低的生成困惑度。想少步、想接 CFG 的人可以先看 ELF;想严格一步、想要可微终点前瞻,FMLM 的 flow map 更直接。
正文没有单独的局限节。附录自己说,步数再往下砍,ELF 会掉点,一步、两步仍然难,要靠渐进蒸馏。最好的嵌入来自冻结预训练 T5,可学习嵌入最差,连续空间的质量很大程度是借来的。生成困惑度会把无聊重复打成低分,他们用熵盯着,但没报似然。ELF-B 另算 35M 编码器,和 170M 基线对比时参数口径并不齐。规模停在 652M 和 OWT/WMT/XSum,没有和自回归大模型比延迟。多训 token 没有继续涨点,数据效率数字好看,也说明这条曲线已经走平。