RTX 5090+5060Ti极限跑2.4T模型,实测0.8 tok/s
mossy_troll_84 · reddit · 2026-08-14
一位开发者在消费级硬件上成功运行了参数量高达 2.4T 的 Qwen3.8-2.4T-A95B 模型,并详细分享了性能实测数据与配置经验。
硬件与环境
- GPU: RTX 5090 (32GB) + RTX 5060 Ti (16GB)
- 其他: AMD Ryzen 9 9950X3D, 128GB DDR5 内存
- 模型: Unsloth 的 Q10 量化版本 (约 397 GiB)
性能表现
在 32 token 的生成测试中,模型达到了 0.80 tok/s 的生成速度。开启原生 MTP(推测解码)后,速度提升了约 3.64%,总耗时缩短了 2.74%。测试显示 MTP 的接受率达到了 90.48%。
配置细节
作者分享了最佳的 llama.cpp 参数设置,包括将张量分割比例设为 4,1,并将 91 个 MOE 专家层卸载到 CPU。为了防止 MTP 导致显存溢出,第 92 层的专家张量被强制保留在 CPU 上运行。
「Infra」频道最新
- 曝 OpenAI 购入 Cerebras 4.2% 股份,为超快速模型发布铺路 — ryanmerket · 2026-08-14
- 黄仁勋回顾 DGX 十周年:新桌面机算力达初代 5 倍 — nvidia · 2026-08-14
- 英伟达携手 Runway:一天内将 Gen-4.5 引入 Vera Rubin 平台 — nvidia · 2026-08-14
- RTX 5090实测:SageAttention视频生成提速近2倍 — gabxav · 2026-08-14
- CoreWeave 推出沙盒环境:手机即可远程驱动 Claude 智能体 — wandb · 2026-08-14
- AI 算力基建遇阻?预测市场押注美国将出台数据中心禁令 — Polymarket · 2026-08-14