开源预训练以约 10% 成本追平 Llama 3.2 1B,576B checkpoint 数据公布
jon_durbin · x · 2026-10-04
开发者 jondurbin 公布其开源预训练项目「Kappa run」的阶段性结果,并宣布停止该轮训练。
- 在 9T tokens、576B checkpoint 阶段,模型在 ARC-C、OBBA、TQA 等基准上超过了 Llama 3.2 1B,在 ARC-E、SciQ 等上接近持平
- 每 token 训练成本比对照便宜约 90%,作者称之为可靠的初步胜利
- 已知问题:Gated DeltaNet-2 某个头的 per-channel decay gate 发生下溢(underflow)
- 下一步计划:增大模型宽度、移除 shared experts;作者认为本轮推理(reasoning)表现平平可能与此有关,但 GDN2 的问题使归因尚不确定
所属事件:开源预训练以十分之一成本追平 Llama 3.2 1B(3 条相关)→
「研究」频道最新
- p=0.05 的经济学实验结果仅 25% 概率能复现 — RexDouglass · 2026-10-04
- 数学研究 Agent 自称将 π 无理数度量上界压到 6.0446 — Michael_D_Moor · 2026-10-04
- Bittensor 生态 Synth:200+ 模型 24/7 比拼金融概率预测,上线波动率 CRPS — bittingthembits · 2026-10-04
- RL 环境本质是数据:未饱和时推进前沿,饱和后失效 — Shahules786 · 2026-10-04
- Josh Gans 新论文:人为何对机器的道德要求高于人类 — joshgans · 2026-10-04
- 实测 18 个 LLM 开放式问答多样性:没有一个模型样样最强 — gregd_nlp · 2026-10-04