新架构 NCP 只用 51% 训练量追平 7B 模型预训练损失

mark_k · x · 2026-09-13

NCP-ArchPreview 是一个 8.9B 参数的隐空间语言模型,不只预测下一个 token,还学习预测跨越多个 token 的离散概念,再将这些概念反馈给 token 生成。研究者称其仅用 51.3% 的训练 token 就追平了 OLMo-3-7B 的最终预训练损失,下游基准平均高出 2.45 分,GSM8K 提升 5.99。模型权重、训练配方和 checkpoint 全部开源。如果结果经得起缩放验证,「下一概念预测」可能实质性改变前沿模型的训练经济学。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →