决定推理性能的是 Kernel 而非模型:同一模型同卡表现可天差地别
Roger_M_Taylor · x · 2026-09-23
Ahmad Osman 长文解释推理性能的真正瓶颈所在:你运行的其实是 Kernel,不是模型。
- 模型只是计算图,推理引擎是调度器/优化器/执行器,真正干活的是 MatMul、Attention、RMSNorm、KV cache、量化线性、采样等各类 Kernel,以及把数据「少写回内存几次」的融合 Kernel
- 同一模型、同一 GPU、同一显存,性能可以天差地别:差别在于一方用了理解硬件的优化融合 Kernel,另一方通过 47 次微小 kernel launch 反复搬运 tensor,然后错怪 GPU
- 他此前的观点是:不该先选推理引擎,而应先定硬件策略、负载形态和服务模型,引擎随后跟进;更底下一层是选定文件编码和 kernel 路径
- 比喻:模型是菜谱,硬件是厨房,Kernel 是刀和锅——坏 Kernel 让人说「这模型真慢」,好 Kernel 让人惊呼「这怎么本地跑得动」
「Infra」频道最新
- tinygrad 在 MI300X 上跑出 MiMo-V2.6-Pro 约 200 tok/s — AIFlow_ML · 2026-09-23
- 爆料:64GB 版 RTX 5090 研发中,但短期内难上市 — AIFlow_ML · 2026-09-23
- Swarm 推出 Qwen Image-2.1 推理引擎:1K 图生成仅 0.5 秒 — bingxu_ · 2026-09-23
- MTP 头被静默忽略:修复三行代码让 Mac 本地解码提速 63%-79% — Micha0827 · 2026-09-23
- 开源自托管备份方案Pluton:Restic+Rclone加密备份跨云复制 — tom_doerr · 2026-09-23
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23