个人从零训练 102M 递归 BitNet:三元权重+权重共享,不到 5B token 上 64K 上下文
Illustrious-Fig-2280 · reddit · 2026-10-11
作者发布 Recursive BitNet N-Gram 102M,一个从零训练的小型实验模型(权重、推理代码与评测均在 Hugging Face 开放),组合了三元权重、共享 transformer 层和哈希 n-gram 嵌入。
架构要点
- 102.28M 参数,hidden size 1,024,GQA(16 查询头/4 KV 头),squared-ReLU FFN
- 6 个 transformer 块跑两次(权重共享)得到 12 层有效深度,每次 pass 独立 KV cache
- BitLinear 用 {-1, 0, +1} 三元缩放权重前向,训练保留 FP32 主权重与 BF16 激活
- 因果 2/3/4-gram token 嵌入哈希进查找表加到输入嵌入,仅增约 1.6M 参数
训练:两阶段共处理 4.703B token——骨干网在 4×B300 上以 2K→4K 上下文训练 3.487B token,加 n-gram 分支后单卡 B300 以 64K 上下文续训 1.216B token。数据含教育文本(FinePDFs-Edu/DCLM/FineWeb-Edu)、指令对话(SmolTalk2)、代码、工具调用(Hermes、ToolACE、WebLINX),以及本地生成的长程记忆 episode(约 1/8 续训更新使用,跨度最远 60K token)。
评测(lm-eval 0.4.12,zero-shot,2048 打分上下文):ARC-E 40.11%、ARC-C 23.63%、PIQA 57.62%、WinoGrande 51.22%、BoolQ 58.65%、HellaSwag 27.27%,平均 40.59%。
「模型」频道最新
- 马斯克晒 Grok 代购乐高:一句话完成调研加下单 — elonmusk · 2026-10-11
- Google 发布 EmbeddingGemma 2:7.4 亿参数多模态嵌入可跑在手机上 — dl_weekly · 2026-10-11
- 爆料称 Grok 4.8 参数达 2.5 万亿,较上代激增 67% 即将发布 — mark_k · 2026-10-11
- TensorFold 1.0.7 上线 Living Weights:一条事实写入约 10 个新神经元 — HankYeomans · 2026-10-11
- Arena 榜单 88 分 vs 83 分差多少?实测误差率相差一倍 — i_dg23 · 2026-10-11
- 曝 Anthropic 下一代模型 Fable 5.5 一次生成即成 SVG — koltregaskes · 2026-10-11