On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu
cs.CL
2026-08-31
Qwen3.8-Flash-Next是125B稀疏MoE、每token激活6B,外加51B主机内存n-gram表。14项预训练基准上赢前代8项、其余最多落后2.6分,激活参数、训练token都是三分之一,训练FLOPs大约九分之一。
Qwen上一代旗舰是397B总参、每token激活17B。下一代要把质量留住,把激活量、训练token和FLOPs一起砍下来。架构改动会同时碰到三件事:下游分数、训练/预填充/解码成本、最优超参和稳定性。这篇把这三件事当成同一个设计问题,每改一处都沿着这三条轴报。
一个反复出现的观察:loss和下游准确率并不总同向。n-gram词表越大loss越低,下游分数却会饱和;把残差读写做成数据依赖,loss只掉一点,基准却能多涨一截。只看loss会做错选择。
Token混合是层间混合:每四层里三层Gated DeltaNet、一层全局注意力。GDN把前缀压进固定大小的循环状态,用衰减门和delta写入做定向擦写,解码时KV缓存不再随长度线性涨。全局注意力层保留有限状态记忆给不出的直接检索。继续预训练时这些全注意力层换成Qwen Sparse Attention:轻量indexer按微块打分再展开成稀疏核注意力,索引复杂度从O(n²)降到O(n²/r)。落地配置是token预算2048、压缩比4。QSA先蒸馏稠密注意力分布,再和骨干一起做稀疏训练,256K上下文上loss差大约10⁻⁴。
残差被加宽成四条分支,经逐元素sigmoid门读出,叫Gated Residual。加宽本身就有容量,门决定容量花在哪,并提供训练所需的再缩放。分支之间的混合矩阵被拿掉,少一次残差全读,解码更省带宽。
容量还加在骨干外面:第2层放一张n-gram嵌入表,短n-gram当key,表放主机内存、异步预取。单层比多层更划算,词表放大时loss单调下降,中文基准跟着涨,其他下游会饱和。
优化器用Muon处理二维线性映射,嵌入、输出头、MoE路由和GR的低秩投影仍走AdamW。拼接参数先拆再正交化。新架构把最优学习率和batch size往上推,batch size预热不再需要,还白白多18.8%的优化步。
基座对比Qwen3.7-Plus-Base(397B/17B)和Qwen3.8-27B-Base:
| 基准 | Flash-Next 6B激活 | 27B稠密 | Plus 17B激活 |
| MMLU | 90.36 | 87.51 | 90.43 |
| MMLU-Pro | 73.23 | 68.60 | 70.90 |
| SuperGPQA | 51.36 | 44.86 | 48.42 |
| MATH | 72.78 | 60.54 | 74.38 |
| MultiPL-E | 79.09 | 74.50 | 81.68 |
| MGSM | 89.33 | 86.37 | 85.42 |
14项里赢Plus 8项,其余最多落后2.59分(MultiPL-E)。25B-A3B消融里,GDN混合均分53.81,全注意力49.87,滑动窗口混合51.15。QSA在1M上下文上,注意力模块预填充快7.6倍、解码快4.9倍;RULER超过512K从90.08到93.00,MRCR在512K从30.66到40.53。4倍最优学习率压力测试下,旧结构频繁尖峰,新配方全程稳住。生产训练没有一次loss尖峰,也没用qk-clip或SwiGLU-clip。
这是一份把架构、核、优化器和稳定性绑在一起的设计备忘录,不是单点模块论文。做长上下文推理服务的人可以直接抄三件事:每四层插一次检索注意力、用QSA把indexer复杂度按微块压下去、把n-gram表放到主机内存换几乎免费的参数。Muon加上门控残差会把最优学习率和batch size一起上移,旧的warmup习惯可以丢掉。
对大多数只调LoRA的人,这篇的可迁移部分是「loss和下游会打架,两项都要看」以及「稳定性本身会改变最优超参」。
基座在MATH上落后Plus 1.60分,MultiPL-E落后2.59分,编码和竞赛数学并没有被小激活量完全兜住。n-gram词表在固定总参预算里替换MoE专家时,下游几乎没有增益,它更像外挂记忆而不是骨干替代。QSA的主数字来自继续预训练阶段,从零预训练是否同样成立没有报。压力测试在中等规模上用高学习率复现不稳定性,和满血训练的对应关系仍是外推。文章几乎不谈后训练对齐和对聊天模型的影响。