作者用 Claude Code 造 10k tok/s CPU 小模型,训练损失单调下降
GregoryDiamos · x · 2026-09-07
作者 Gregory Diamos 提出应重新审视「小得离谱」的神经网络:他需要一个能在 CPU 上跑到 10k tok/s 的模型做数据处理,于是让 Anthropic 的 Claude Code 用一批 token 自主构建。在 4.91B token 的训练中,平滑后的训练损失在每个课程阶段内单调下降,且到训练结束时仍在下降,未出现饱和。作者称过程中有三个有趣的发现(详见附图/后续推文)。
所属事件:开发者用 Claude Code 造出超高速 CPU 推理小模型(4 条相关)→
「编程与Agent」频道最新
- 研究者提出智能体攻击面公式:模型+数据+工具+权限 — JayAlammar · 2026-09-07
- 作者用 GPT-6 Astra vibe coding 出《奥德赛》交互叙事长卷 — Pristine_Good7326 · 2026-09-07
- GPT-6 Astra 搭配 MCP 一条 prompt 让 AI 自动接管你的重复工作 — TawohAwa · 2026-09-07
- 实测:Code X 的 Computer Use 操作不了微信桌面端,飞书却可以 — yihui_indie · 2026-09-07
- MCP 工具权限怎么管?Agent Proxy 按主机与方法预授权 — radim11 · 2026-09-07
- Agent 记忆≠可信上下文层,企业记忆赛道遭质疑 — femke_plantinga · 2026-09-07