新架构 NCP 只用 51% 训练量追平 7B 模型预训练损失
mark_k · x · 2026-09-13
NCP-ArchPreview 是一个 8.9B 参数的隐空间语言模型,不只预测下一个 token,还学习预测跨越多个 token 的离散概念,再将这些概念反馈给 token 生成。研究者称其仅用 51.3% 的训练 token 就追平了 OLMo-3-7B 的最终预训练损失,下游基准平均高出 2.45 分,GSM8K 提升 5.99。模型权重、训练配方和 checkpoint 全部开源。如果结果经得起缩放验证,「下一概念预测」可能实质性改变前沿模型的训练经济学。
「模型」频道最新
- 网友推荐 Sol Medium:周限额消耗明显更慢 — ___Patrice___ · 2026-09-13
- Conitzer 晒模型谄媚翻车:夸英文却不敢当着法语说 — conitzer · 2026-09-13
- NVIDIA 开源 Nemotron 3 Ultra 达 IMO 金牌水平,30/42 分并公开全套配方 — mark_k · 2026-09-13
- Claude 计划 5 小时限额 1 小时耗尽,开发者被迫切 Codex 实现 — rudrank · 2026-09-13
- 评论:Ant 与 OpenAI 即使停在前沿,也能把 Astra 级模型蒸馏到 $0.3/1M — teortaxesTex · 2026-09-13
- GPT-6 Astra 一次生成完整作品集网站,作者晒图求评价 — Tegadesigns · 2026-09-13