亚马逊提出ALoDLM:按token难度自适应分配循环深度
amazon · hf · 2026-10-06
ALoDLM:自适应循环的扩散语言模型
扩散语言模型(DLM)能并行预测多个 token 实现快速生成,但质量始终落后于同规模自回归(AR)模型。论文将这一差距归因于计算难度错配:部分未知 token 很容易预测,另一些则需要更多计算,而现有 DLM 在每一步去噪中对所有未知位置施加统一计算深度。
ALoDLM 用 token 级自适应隐式循环替代统一计算:每步去噪中迭代精炼隐表示,按 token 难度分配算力——准备就绪的 token 提交为离散上下文,未定的 token 保留隐状态继续循环精炼。训练上将 token 级计算调度建模为隐变量,推导出条件负证据下界(NELBO)联合学习预测与算力分配。
结果:在 1.7B 和 8B 两个规模训练,11 项基准上平均分全面超越所有受评 DLM 及对应 AR 基线,同时保留快速并行解码,在优化推理引擎下取得优异的质量-效率权衡。
「模型」频道最新
- 同等智能下该看单任务成本:Opus 多花 94% token 反而便宜 23% — ChrisGPT · 2026-10-06
- 发文者称 GPT-6 Astra 首个达到世界级天体物理水平的 AI — johnseach · 2026-10-06
- $500 订阅在雅加达是巨款,区域 PPP 定价引热议 — sujingshen · 2026-10-06
- Reflection AI 发布首个开源模型 Beam,估值 250 亿美元 — WebAssemblyMan · 2026-10-06
- 曝 OpenAI 拟合并 Chat 与 Codex 额度,基础聊天限额引担忧 — Iwantthegreatest · 2026-10-06
- 微软页面被曝证实 GPT-6 系列采用 Looped Transformer — teortaxesTex · 2026-10-06