零额外算力修复非自回归生成,困惑度最高降63%

kastnerkyle · x · 2026-08-02

非自回归文本生成中的离散流模型常面临一个问题:在上下文仍被掩码时强行预测 token,导致模型盲目猜测并引入大量噪声。

这篇论文提出了一种极其简洁的修复方案:重新加权损失函数并微调采样器,使模型在计算损失前能感知当前可用的局部上下文。该方法几乎不增加任何计算成本,却在 OpenWebText 上将困惑度最高降低了 63%,并最终达到了半自回归模型的性能水平。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →