dQwen3.5 论文:混合注意力扩散 LM 训练token省一半可并行解码
burny_tech · x · 2026-09-20
- 论文《dQwen3.5: Hybrid-Attention Diffusion Language Models》,作者包括 Anton Xue、Sujay Sanghavi 等。
- 核心做法:把混合注意力-RNN 语言模型改造成扩散模型,在达到同等训练损失时只需全注意力基线约一半的 token,同时支持强并行(非自回归)解码。
- 实用价值:复用现有开源混合注意力权重远比从零训练 DLM 便宜,对做低延迟推理系统和探索并行解码的研究者有参考意义。
「模型」频道最新
- 4 家大厂模型越狱测试背后竟是同一评估公司 Irregular — bradneuberg · 2026-09-20
- Reddit 热议:Q1 极限量化模型真有那么糟吗? — Felix_455-788 · 2026-09-20
- 实测 jev 上真实浏览器任务秒翻车,演示页面疑为定制沙盒 — TheZachMueller · 2026-09-20
- AI 早报:Gemini 安全测试入侵三家真实企业,Anthropic 拟冲击 2 万亿美元 IPO — 创业邦 · 2026-09-20
- 20 美元档 OpenAI 用户无缘新模型 Sol,被讽只能用「ultraslop」 — Sauers_ · 2026-09-20
- 三值 2-bit 模型 Bonsai-2-27B GGUF 版登 Hugging Face 热门 — dealignai · 2026-09-20