Length-Adaptive Decoding for Masked Diffusion Machine Translation
Yan Zhan, Mengkai Hou, Wanting Zhang, Zhijun Gao
EMNLP 2026
cs.CL, cs.AI, cs.LG
2026-08-23
掩码扩散翻译须先定目标长度。Entropy-Valley用全掩码平均熵挑画布、无需再训练,英中与中英收回参考长度COMET增益的64.9%和65.3%。
自回归翻译生成到 EOS 就停。掩码扩散语言模型先拿到一块固定长度的目标画布,再逐步揭开 mask。训练时 EOS 接在画布后面,测试时模型倾向于填满你给的长度。画布太短会丢掉动词、占位符、数字;太长又给重复和幻觉留空位。
现有扩散解码论文多半讨论先揭哪些位置。长度要么直接用参考译文(这是上限,不能上线),要么用语料级源到目标比率。一个全局比率照顾不了短命令、带占位符的句子和习惯性压缩。经典非自回归翻译的长度头、长度束搜索,又要求改训练目标,套不到已经 LoRA 微调过的解码器-only 扩散骨干上。
Entropy-Valley(EV)在解码前问冻结模型:哪块画布你最有把握填。给定源句,用一组固定比率生成最多五个候选长度(含预留的 EOS 槽),每个候选做一次全掩码前向,用除 EOS 槽以外位置的平均预测熵打分,选熵最低的谷,再按和基线相同的 32 步最小熵揭开顺序解码。
比率网格按方向固定,来自 WMT19 中位数附近:英→中 {0.70…0.90},中→英 {1.00…1.40},英→德 {1.50…1.90}。测试时不用当前句的参考长度,不加长度预测器,也不改骨干。额外开销最多五次探查前向,相对 32 步去噪很小。
直觉很简单。画布太短,源内容被挤进过少的槽,分布更散;太长则多出来的位置没有自信的 token。平均熵把这种不匹配在真正去噪之前暴露出来。
LLaDA-8B-Base 每方向 LoRA-SFT 200k WMT19 句对,三随机种子,WMT22 每方向 2,037 句,32 步 MED。
| 方向 | 固定比率 | Entropy-Valley | 参考长度上限 | 间隙收回 |
| En→Zh COMET-22 | 0.8345 | 0.8517 | 0.8610 | 64.9% |
| Zh→En | 0.8266 | 0.8431 | 0.8519 | 65.3% |
| En→De | 0.7170 | 0.7240 | 0.7382 | 33.0% |
sacreBLEU 分别 +1.85、+1.63、+0.82。配对检验在英中双向支持充分,英德句子级证据较弱。给比率基线同样甚至更多前向,最多只再涨 0.001 COMET,解释不了主增益。
同数据微调的 LLaMA-3-8B 自回归基线:英→中和 EV 基本打平(85.07 对 85.17,百分制),中→英 EV 更高(84.31 对 83.68)。英→德自回归仍高约 8.8 分,连 LLaDA 的参考长度上限也差约 7.4 分,所以这个方向的短板不在选长度。
对照实验把长度钉在参考译文上再扫揭开顺序,英→中各顺序只跨 0.0081 COMET;固定 MED、换长度来源则跨 0.0265。EV 的长度误差仍远离参考长度,却收回约 65% 的 COMET 间隙:它选的是好填的画布,不是人类参考长度。英→中占位符保留从 66.9% 到 89.1%,数字从 77.6% 到 81.3%。三位双语专家在每方向 100 句上,中→英充分性 +0.50、多数票 45 对 25;英→中充分性 +0.18,多数是平局。流畅度变化都很小。
Dream-Base 和 DiffuLLaMA 上 EV 仍高于比率,但收回比例随骨干和分词器变。
如果做掩码扩散 MT,先别把预算砸在更花哨的揭开顺序上。这篇的诊断很硬:在这个设定里,画布长度比揭开顺序更动分数。EV 的工程成本接近零,五次前向就能部署。
对扩散语言模型更一般的提示是:固定画布把「何时停」从生成过程里拿掉了,必须在解码前显式补回来。
候选比率网格按方向定死,还用 WMT22 诊断子集看过范围,严格说不是完全零超参。网格盖不住需要更强压缩的句子,英→中不能选低于 0.70 倍源长度的画布。英→德在 T≥64 时固定比率会略超 EV。人工评估只有中英。骨干换了,绝对分和间隙收回都会变,DiffuLLaMA 中文侧收回更小,和分词覆盖有关。