8.9B潜空间模型用一半token追上OLMo-3损失

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

The Intern-NCP Team, :, Jiaqi Cao, Chiyu Chen, Shuang Cheng, Xu Cheng, Beiya Dai, Yufan Feng, Kewen Ge, Ruijun Ge, Jiayi Huang, Yang Jiao, Dahua Lin, Zhouhan Lin, Yifan Liu, Yuliang Liu, Biqing Qi, Mowen Ruan, Junzhe Shen, Yunchong Song, Hao Sun, Zhongbo Tian, Yixuan Wang, Rubin Wei, Jiaxin Xiong, Kangyu Yang, Qian Yao, Qi Zhang, Bowen Zhou

cs.CL

2026-09-10

上海AI Lab把下一概念预测做成主目标:8.9B模型用51.3%的5.73T token追上OLMo-3-7B最终损失,下游总分高2.45、GSM8K再高5.99。

这篇在解决什么

自回归语言模型一直在预测下一个token。多token预测(MTP)往前多看几步,监督信号仍钉在表面词上。视觉里的latent diffusion已经证明:换到更抽象的表示空间,建模效率会上去。语言这边,JEPA式「预测未来表征」还很少被真正做到万亿token规模。

NCP-ArchPreview要验证一件事:把模型自己学到的离散概念当成一等预测目标,和next-token prediction一起训,能不能在标准自回归生成不被破坏的前提下,把预训练效率拉上去。对照是同一套Dolma-3数据上的OLMo-3-7B。

方法

骨干拆成三段:16层Token Encoder、8层Concept Module、16层Token Decoder,总参数8.94B,隐层4096。每4个token状态做均值池化得到一个连续概念,再用乘积量化(PQ)切成32段、每段128个码字,拼出离散概念词表。Concept Module在这个词表上预测下一个概念,预测结果按因果对齐、重复4次,加回token通路,引导后续生成。

训练同时优化NTP和NCP。层级残差分两类:模块内部的IRC,以及Encoder→Concept、Encoder→Decoder、Concept→Decoder的CRC,让信息在token层和概念层之间流通。概念通路序列长度大约是token的1/4,所以Concept Module每层参数跟标准Transformer块相当,算力大约只有四分之一。

预训练跟OLMo-3一样吃5.73T Dolma-3 token,上下文8192。中期训练再加约100B token。推理时仍按token自回归解码,概念通路是训练期的额外监督和内部引导,不是换一套生成接口。

结果

Stage-1预训练里,NCP用51.3%的token就摸到OLMo-3-7B的最终损失,收敛约1.95倍;全程损失低0.091。下游宏平均46.59→49.04(+2.45),GSM8K 39.27→45.26(+5.99),PiQA 72.25→80.85(+8.60)。数学子集平均+3.75,代码平均+2.64。

Stage-2中期训练后,损失优势还在(1.51倍收敛),但下游总分只剩+0.59(56.98→57.57)。GSM8K仍高3.34到83.02,代码平均却掉了0.65,HumanEval从49.31掉到45.62。中期数据里代码大约只占10%,拟合整体混合会伤到低权重领域。

设置对照结果
Stage-1 宏平均OLMo-3-7B 46.5949.04(+2.45)
Stage-1 GSM8K39.2745.26(+5.99)
追平最终损失100% token51.3% token
算力对齐8.9B基线100% FLOPs约85% FLOPs接近其损失
IsoFLOPOLMo-31.74×计算效率

组件消融按「加Concept Module→加残差→加NCP」递进,损失逐步下降。1B尺度上IRC+CRC相对无残差再降0.0323损失,额外分析FLOPs只有0.051%。训完后只更新17M的VQ码本和预测头,代码四项平均从30.04提到32.69,全量微调会把MBPP+砸掉22.49分。把概念表示灌进DFlash2草稿模型,平均接受长度5.933→6.180(+4.17%)。

为什么重要

这是目前公开的、最大规模的潜空间语言模型演示:概念预测不再是辅助损失,而是能跟NTP一起撑到5.73T的架构。从业者能直接拿的有三块:开源的Stage-1/Stage-2权重和每10万步检查点;17M参数的VQ适配接口,适合不想动骨干的领域微调;以及投机解码里几乎零代价的概念注入。

它仍是渐进架构,不是换一代范式。生成接口没变,收益主要在预训练效率和部分下游任务。中期训练已经说明,损失优势不会自动变成全面下游优势。

局限与存疑

作者自己写了两条。当前预览没做长上下文训练,而概念通路天然压缩序列,长上下文本应是更合适的试验场。损失到下游的换算也不稳:预训练+2.45,中期只剩+0.59,而且跟数据配方绑定。

另外几个数字需要自己读。Stage-2代码和ARC-C是退步的。VQ适配虽然保住代码,通用平均仍掉0.42。对照的OLMo-3-7B是32层、约7B,NCP是40块当量、8.94B;作者补了参数对齐和算力对齐消融,完整模型接近40层稠密Transformer,但只用了85%算力。主表仍不是严格同参数同结构的一对一。

术语

原文与代码

相关论文

全部论文解读