一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈

Wonderful-Income7415 · reddit · 2026-07-21

## 一个 CPU 原生的严格 W1 Transformer 训练 runtime 正在开发中 作者介绍了 **GhostBit**:一个用 C++20 编写的实验性 CPU 原生 runtime,目标是在**内部权重严格限制为 {-1, +1}** 的前提下,训练小型 Transformer 语言模型。 ### 已包含的能力 - strict-W1 BitLinear 层 - CPU 原生训练与推理 - 早期 W1/A8、W1/A1 实验路径 - 面向 AVX2 的 kernel - 正确性测试与梯度检查 - 严格的二值 checkpoint 导出验证 - 可复现 benchmark - 带 `PROMOTE / HOLD / REJECT` 的门控 A/B 实验 - cache、tiling、压缩优化器状态等实验 ### 当前状态 作者明确表示:项目**还不能生产可用**,目前只在小模型和受控工作负载上测试过,也**不主张 CPU 已经能在通用 LLM 训练上超过 GPU**。 他提到一些合成实验结果看起来鼓舞人心,但仍需要更广泛的 baseline、更大模型、更多硬件配置和独立复现。仓库里保留了 100 多轮实验记录,包括失败和不确定结果。 ### 作者想要什么 帖子主要在寻求诚实反馈:**严格 W1 的 CPU 原生训练是否仍值得研究**、应该拿什么外部 baseline 才可信、哪些部分可能整理成论文或可复现的系统贡献,以及是否有研究组或开源组织愿意接手。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →