RTX 5090+5060Ti极限跑2.4T模型,实测0.8 tok/s

mossy_troll_84 · reddit · 2026-08-14

一位开发者在消费级硬件上成功运行了参数量高达 2.4T 的 Qwen3.8-2.4T-A95B 模型,并详细分享了性能实测数据与配置经验。

硬件与环境

性能表现

在 32 token 的生成测试中,模型达到了 0.80 tok/s 的生成速度。开启原生 MTP(推测解码)后,速度提升了约 3.64%,总耗时缩短了 2.74%。测试显示 MTP 的接受率达到了 90.48%。

配置细节

作者分享了最佳的 llama.cpp 参数设置,包括将张量分割比例设为 4,1,并将 91 个 MOE 专家层卸载到 CPU。为了防止 MTP 导致显存溢出,第 92 层的专家张量被强制保留在 CPU 上运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →