Qwen3.8-Next 论文:1/9 训练算力追平前代 397B 模型
NielsRogge · x · 2026-08-28
Hugging Face 工程师 NielsRogge 宣布 Papers with Code 现在也支持非 arXiv 的外部 PDF:通过 CRON 任务,提交的外部论文进入队列后用 Chandra OCR 模型转成 Markdown,从而启用「与论文对话」功能,队列跑在 Hugging Face Jobs 上。他并附上 Qwen3.8-Next 架构论文作为示例。
该论文要点(125B 参数、每 token 激活 6B 的稀疏 MoE,另有 51B 的 n-gram 嵌入表放在加速器外):
- 在 14 个预训练基准上,仅用 1/3 激活参数、1/3 训练 token、约 1/9 训练 FLOPs,就在 8 个上超过 397B-A17B 前代,其余最多落后 2.6 分
- Token 混合采用 Gated DeltaNet 与全局注意力的分层混合,每 4 层有 1 层全注意力;继续预训练时全注意力层替换为 Qwen Sparse Attention(QSA),用压缩轻量索引器按微块粒度打分
- 残差流扩展为四分支并用逐元素门控读出(Gated Residual)
- 评估沿三条轴:loss+下游基准、训练/prefill/解码成本、对最优超参和稳定性的影响;发现 loss 与下游精度不总是一致——扩大 n-gram 词表单调降 loss 但下游精度饱和
- 架构配合 Muon 优化器使最优学习率和 batch size 上移,不再需要 batch size warmup,压力测试下稳定性显著提升
「模型」频道最新
- 腾讯开放 Hy4 预览权重:770B MoE、49B 激活、1M 上下文 — Snoo26837 · 2026-08-28
- 跑分相近体积差一倍多:Qwen3.8-Flash-Next 疑靠规模追平 DeepSeek — vini542reddit · 2026-08-28
- Grok 4.6 登顶 GPQA Diamond:95% 并列第一,超 Opus 5 与 GPT-5.6 — XFreeze · 2026-08-28
- Hy4 preview GitHub 仓库公开:256 专家、内置 MTP 层与 Gated DSA 注意力 — aigclink · 2026-08-28
- 混元 Hy4 preview 八项目实测:前端审美大增,长程任务稳 — vista8 · 2026-08-28
- PlayWorld 评估揭示世界模型高分低质 — jiqizhixin · 2026-08-28