小模型塞进 L2 缓存,Intel CPU 上跑出 14572 tok/s
GregoryDiamos · x · 2026-09-07
Gregory Diamos 为满足数据处理管线需要 10k tok/s 的 CPU 模型,让 Claude Code 用大量 token 构建一个「极小神经网络」。结果在 Intel Emerald Rapids CPU(AMX 加速)上,把激活参数全部装进 L2 缓存后达到 14572 tok/s。他称过程中有三个有趣的发现(详见链接),主张重新审视「小到离谱」的神经网络在推理/数据处理场景的价值。
所属事件:开发者用 Claude Code 造出超高速 CPU 推理小模型(4 条相关)→
「Infra」频道最新
- Hesamation 力荐:讲透 LLM 大规模训练的顶级技术书 — Hesamation · 2026-09-07
- 我的 OpenAI key 被盗后,我发现了一个专挖 Docker 镜像层的秘密扫描器 — Ubunta · 2026-09-07
- 双 5080 加 128GB 内存:32GB 显存本地跑什么模型 — whatyathinkk · 2026-09-07
- 长鑫存储回应与苹果合作传闻,暗示合作基本坐实 — zephyr_z9 · 2026-09-07
- AMDIFA2026押注个人AI:192GB统一内存平台与96核桌上超算亮相 — APPSO · 2026-09-07
- 联想Yoga Pro 9n笔记本可本地跑1200亿参数模型,Windows入局Agent主机之争 — APPSO · 2026-09-07