个人从零训练 102M 递归 BitNet:三元权重+权重共享,不到 5B token 上 64K 上下文

Illustrious-Fig-2280 · reddit · 2026-10-11

作者发布 Recursive BitNet N-Gram 102M,一个从零训练的小型实验模型(权重、推理代码与评测均在 Hugging Face 开放),组合了三元权重、共享 transformer 层和哈希 n-gram 嵌入。

架构要点

训练:两阶段共处理 4.703B token——骨干网在 4×B300 上以 2K→4K 上下文训练 3.487B token,加 n-gram 分支后单卡 B300 以 64K 上下文续训 1.216B token。数据含教育文本(FinePDFs-Edu/DCLM/FineWeb-Edu)、指令对话(SmolTalk2)、代码、工具调用(Hermes、ToolACE、WebLINX),以及本地生成的长程记忆 episode(约 1/8 续训更新使用,跨度最远 60K token)。

评测(lm-eval 0.4.12,zero-shot,2048 打分上下文):ARC-E 40.11%、ARC-C 23.63%、PIQA 57.62%、WinoGrande 51.22%、BoolQ 58.65%、HellaSwag 27.27%,平均 40.59%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →