Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
cs.AI
2026-08-14
Mobius 架构把 FFN 知识抽成全局共享 Memory、Self-Attention 变成可迭代查询它的 Reasoner:7B 从头训同分只用 62.6% 数据,35B 持续预训练分数反超 Qwen3.5-35B 且端到端推理快近 4 倍。
Transformer 有个结构性问题:FFN 存知识、Self-Attention 做推理,但每层各带一份 FFN,知识被分散复制在几十层里;残差连接只从浅层流向深层,深层的注意力够不到浅层的知识。论文的推断是:关键知识若没在浅层被激活,模型这一轮就解码不出高信息量的 token,只能靠长思维链往外吐低信息量的过渡 token 慢慢磨。知识冗余存储吃参数,思维链冗余吃推理算力,两个成本同源。
想直接加反向残差连接,计算图变复杂、难并行,工程上不友好。Mobius 选了条间接路:让所有层共享同一个超大知识库,等于人人都能读到全模型的知识。
Mobius-v0 的三块:
配套的是动态潜空间推理:把深思、试错、修正这类原本要显式生成 token 的过程,内化成连续向量的优化,按 token 动态分配算力。作者把它定位成 Looped Transformer 与潜空间推理路线的合流升级。
两条验证线:7B-A1B MoE 从头训(1TB token,与同规格 Transformer 对照);Intern-S2-Mobius 从 Qwen3.5-35B-A3B 持续预训练 1TB token,再接 SFT 与 RL。
| 设置 | 结果 | 对照 |
| 7B 从头训 MMLU | 同分只用 62.6% 数据(1.6 倍数据效率) | 同规格 Transformer,均 1TB token |
| 35B 通用均分 | 67.88 | Qwen3.5-35B 65.05 |
| MMLU Pro | 89.05 | 85.31 |
| AIME 2026 | 95.31 | 92.08 |
| 科学任务均分 | 52.14 | 18.20 |
| 端到端推理 | 近 4 倍加速,输出长度约 1.5 倍短 | 同题对照 |
| 线代题思维链 | 516 token | Qwen3.5-35B 2364 token |
科学任务那组差距大得反常(Biology-Instructions 51.40 对 3.77),更像持续预训练语料的侧倾,不是架构本身的优势,读的时候要打折。
这是一次严肃的「后 Transformer」架构提案,来自有完整训练基建的团队,而且走的是最贵的那条验证路径:从头预训练对照,加上 35B 规模的持续预训练,不是论文级玩具实验。数据效率与推理加速这两个数字若能被独立复现,影响会越过学术圈——推理成本是当下大模型落地的最大单项开销,「同分快四倍」直击要害。知识库全局共享还顺带打开持续学习的想象:更新知识不必端到端重训, catastrophic forgetting 的老问题有了架构层面的解法入口。当然,这些都建立在结果站得住的前提上。
作者罕见地坦白了两句关键的话:「Mobius 到底是黑掉了题目,还是真的提供了更高效的推理模式,仍有待确定」「更短思维链的精确机制尚未建立」。数据效率的机制同样停留在假说层:归因于层级参数冗余被消除,没有消融或直接证据。
从论文本身看,缺口不少:7B 对照只有 MMLU 一个指标,说服力单薄;35B 那组科学任务的悬殊差距语焉不详;推理加速的「近 4 倍」聚合自多基准吞吐,具体硬件、批大小、解码配置未在本体交代清楚;消融实验(共享 Memory 拆掉会怎样、Reasoner 迭代次数的影响)缺席。这份更像架构宣言加初步验证,复现与第三方评测之前,所有数字都该当「宣称」看。