成本仅为 1/10,开源预训练跑分追平 Llama 3.2 1B,作者复盘四大坑

jon_durbin · x · 2026-10-03

jondurbin 介绍了其 Kappa 预训练运行的初步结果与踩坑复盘:

成绩:在 576B token 的 checkpoint 上,ARC-C、OBQA、TQA 等 benchmark 已超过 Llama 3.2 1B(后者用了 9T tokens),ARC-E、SciQ 等也接近持平,而每 token 成本约便宜 90%。

运行中的问题:

作者称这是一次「扎实的前期胜利」,后续会修复这些问题。

所属事件:开发者以十分之一成本开源预训练追平 Llama 3.2 1B(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →