跑模型其实是跑内核:推理性能差距藏在 fused kernel 里
EAccelerate_42 · x · 2026-09-03
TheAhmadOsman 发长文解释推理性能的本质:你跑的不是模型,而是 kernel。模型只是计算图,推理引擎是调度器/优化器/执行器,真正干活的是各种 kernel——MatMul、Attention、RMSNorm、KV cache、量化线性层、采样,以及避免反复读写内存的融合(fused)kernel。
同样的模型、GPU 和显存,性能可能天差地别:
- 好的推理栈使用理解硬件的优化融合 kernel,让本地跑大模型快得出乎意料
- 差的栈则通过几十次微小的 kernel launch 来回搬运 tensor,然后怪 GPU 不行
结论:说「这个模型慢」往往是 kernel 的问题,这也是各家推理引擎(Llama.cpp、vLLM、MLX 等)的性能差异根源。
「Infra」频道最新
- FastVideo-FastH3 上架 MLX 页面,Mac 本地推理提速工具未发先热 — Structure-These · 2026-09-03
- AI 硬件需求拉动,韩国 8 月出口同比大增近 69% — VraserX · 2026-09-03
- RTX 5090 夜间自动生成股市简报,数字门禁杜绝 LLM 编造数据 — JakeChj · 2026-09-03
- Counterpoint:长鑫存储 Q2 DRAM 市占率达 10% — zephyr_z9 · 2026-09-03
- 开源 RL 框架 Miles 发布:面向企业级 LLM/VLM 后训练 — AravSrinivas · 2026-09-03
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03