Qwen 模型 4070 跑分低 14 倍,竟因层溢出至内存

luckokkkk · reddit · 2026-08-24

用户发现 Qwen3.8-27B 在 RTX 4070 Super 上推理速度仅为 5.7 tok/s,远低于 RTX 5090 的 81.5 tok/s。

排查发现:

解决方案:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →