成本仅为 1/10,开源预训练跑分追平 Llama 3.2 1B,作者复盘四大坑
jon_durbin · x · 2026-10-03
jondurbin 介绍了其 Kappa 预训练运行的初步结果与踩坑复盘:
成绩:在 576B token 的 checkpoint 上,ARC-C、OBQA、TQA 等 benchmark 已超过 Llama 3.2 1B(后者用了 9T tokens),ARC-E、SciQ 等也接近持平,而每 token 成本约便宜 90%。
运行中的问题:
- 某 Gated DeltaNet-2 头的 per-channel decay gate 下溢,导致状态清零,输出 RMSNorm 把近零输出放大上千倍,引发全集群梯度尖峰;
- 严重滞后/慢节点给出的数据被直接丢弃,本应更好地容忍陈旧数据与部分更新;
- 样本打包时未做 masking,对预训练并非最优;
- 首尾层使用 GDN2 可能不如 SWA,暂无明确证据但值得验证。
作者称这是一次「扎实的前期胜利」,后续会修复这些问题。
所属事件:开发者以十分之一成本开源预训练追平 Llama 3.2 1B(2 条相关)→
「Infra」频道最新
- Modal VM 沙箱正式 GA:一套流程跑起 Docker Compose 应用、测试与编码 Agent — charles_irl · 2026-10-03
- 793 人社区投票:oMLX 以 55.5% 成最受欢迎的 Apple MLX 引擎 — HankYeomans · 2026-10-03
- 本地 AI 用户吐槽:为什么大家都甘当「驯兽师」,忍受复杂的折腾流程 — kathi7 · 2026-10-03
- AI 网关成生产级 AI 栈关键控制层,八大核心能力盘点 — goyalshaliniuk · 2026-10-03
- 8GB 显存党的日常:苦盼 Qwen4 35B A3B,先用 Gemma 26B QAT 解馋 — RobustLokiX · 2026-10-03
- 单台 128GB Strix Halo 跑 300B 级 MoE:Kyojin 引擎实测 GLM 26-30 tok/s — Yaniss916 · 2026-10-03