作者用 Claude Code 造 10k tok/s CPU 小模型,训练损失单调下降

GregoryDiamos · x · 2026-09-07

作者 Gregory Diamos 提出应重新审视「小得离谱」的神经网络:他需要一个能在 CPU 上跑到 10k tok/s 的模型做数据处理,于是让 Anthropic 的 Claude Code 用一批 token 自主构建。在 4.91B token 的训练中,平滑后的训练损失在每个课程阶段内单调下降,且到训练结束时仍在下降,未出现饱和。作者称过程中有三个有趣的发现(详见附图/后续推文)。

所属事件:开发者用 Claude Code 造出超高速 CPU 推理小模型(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →