单核 6616 tok/s 涌现基础推理能力,微型神经网络论文引热议
GregoryDiamos · x · 2026-09-08
Greg Diamos 起初只是为了解决一个工程问题:没有大型 GPU 集群预算,却需要一个能在单 CPU 核心上以约 1 万 token/秒处理数据抽取与分类的模型。于是他让 Claude Code 用大量 token 来构建模型,结果意外得到一篇论文和新模型。
核心发现与约束:
- 所有训练与推理都锁定在 Intel Xeon Silver 4514Y 的单个物理核心(OMPNUMTHREADS=1),这是一次 roofline 极限测试
- AMX 在该模型使用的矩阵形状下比 AVX-512 fp32 快约 9 倍:最佳单核 bf16 GEMM 达 2231 GF/s,bf16 在 1024³ 规模下达 976–1074 GF/s,而无 AMX 的 fp32 仅 121 GF/s
- 关键结论:只要活跃参数量小到热权重能装进单核 2 MiB L2 缓存,单核 10000+ tok/s 的生成速度就是简单的算术题
初版帖子一天获得 12 万浏览和 87 条回复,作者在文中回应了社区质疑并指出其中哪些批评是对的。
所属事件:工程师用 Claude Code 造出 CPU 万级吞吐超小模型(8 条相关)→
「Infra」频道最新
- 大型科技公司选址阿根廷巴塔哥尼亚,拟建超大数据中心 — Polymarket · 2026-09-08
- TimesFM 3.0 新增 MLX 后端:苹果芯片原生跑时序预测,M4 Max 每秒 641 序列 — rachittshah · 2026-09-08
- 数据中心建设拉动货运:7月Cass指数跌4.5%却掩盖了真实需求 — kernelangus420 · 2026-09-08
- 官方 llama.cpp 浪费硬件,Strix Halo 优化分支解码近 60 t/s — feelspeaceman · 2026-09-08
- AMD 桌面 AI 工作站内存 2.6TB,达 NVIDIA DGX Station 三倍多 — shashib · 2026-09-08
- Minecraft 创始人吐槽:AI 服务该允许付费直接开高配 VM — DavidSHolz · 2026-09-08