AMX 加速下 Xeon CPU 活跃参数入 L2 缓存跑出 14572 tok/s
GregoryDiamos · x · 2026-09-08
作者讨论在 Intel Emerald Rapids CPU 上用 AMX 加速推理的实验:将模型的活跃参数尽量装入 L2 缓存,在基本 bf16 配置下达到 14572 tok/s 的生成速度。作者也指出通过更好的权重压缩可以进一步提高活跃参数占比,暗示该方案还有优化空间。
所属事件:工程师用 Claude Code 自主设计超小模型,CPU 上跑出 14572 tok/s(7 条相关)→
「Infra」频道最新
- 开发者自制 Windows 托盘 NVIDIA 显存监控小工具 — Due-Committee-9591 · 2026-09-08
- LTX2.5 在 Mac 上纯本地生视频,对比 MiniMax H3 的 36GB 门槛 — cocktailpeanut · 2026-09-08
- 用 RL 训 Kimi 基座模型设计变压器,一次推理压缩数周工程 — ycombinator · 2026-09-08
- 去中心化算力市场跑Agent负载,价格比AWS低3至10倍 — DavidLinthicum · 2026-09-08
- Anthropic 11 个月签下 5170 亿美元算力合同,仍落后 OpenAI 7500 亿计划 — The Decoder · 2026-09-08
- 4GB 显存硬跑 MiniMax H3 视频生成:修好模糊手部要 6 小时渲染一集 — unbenannt1 · 2026-09-08