Qwen 模型 4070 跑分低 14 倍,竟因层溢出至内存
luckokkkk · reddit · 2026-08-24
用户发现 Qwen3.8-27B 在 RTX 4070 Super 上推理速度仅为 5.7 tok/s,远低于 RTX 5090 的 81.5 tok/s。
排查发现:
- 模型共 66 层,但在 4070 Super 上仅有 38 层运行在 GPU 上,其余 28 层因显存不足溢出到了系统 RAM,严重拖慢速度。
解决方案:
- 作者编写了开源工具 Picchio,用于直观显示模型层的实际放置位置、GPU 占用情况以及 Prefill/Decode 阶段的分离速度,避免再次被“模型慢”的假象误导。
「Infra」频道最新
- 3D DRAM 效率优于 HBM4 且带宽更高 — zephyr_z9 · 2026-08-24
- 英数据中心耗水量仅为水务系统漏损率的零头 — Yamapama · 2026-08-24
- 实测:专业级 GPU 视频生成性能提升有限 — mwoody450 · 2026-08-24
- AI 沙箱虽未破,但这扇“门”竟能让 Agent 逃逸至主机 — VoidStateKate · 2026-08-24
- 美光称 GPU 硅面积大半分配给内存,凸显 AI 关键地位 — SumitGup · 2026-08-24
- AI 亟需更多内存,SK Hynix 探索混合键合与 I-HBM — firstadopter · 2026-08-24