小模型塞进 L2 缓存,Intel CPU 上跑出 14572 tok/s

GregoryDiamos · x · 2026-09-07

Gregory Diamos 为满足数据处理管线需要 10k tok/s 的 CPU 模型,让 Claude Code 用大量 token 构建一个「极小神经网络」。结果在 Intel Emerald Rapids CPU(AMX 加速)上,把激活参数全部装进 L2 缓存后达到 14572 tok/s。他称过程中有三个有趣的发现(详见链接),主张重新审视「小到离谱」的神经网络在推理/数据处理场景的价值。

所属事件:开发者用 Claude Code 造出超高速 CPU 推理小模型(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →