硬核实测本地运行 2.4T Qwen 模型
多位硬核开发者尝试在消费级硬件上运行参数量高达 2.4T 的 Qwen3.8-2.4T-A95B 模型极限量化版。测试者使用了包括双 RTX 5090 与三 RTX 5060Ti 在内的五张显卡来运行体积达 397GB 的模型,实测生成速度约为 0.8 tok/s。这表明即便使用高端消费级显卡阵列,本地运行超大规模模型依然面临严峻的性能挑战。
2026-08-14 ~ 2026-08-14 · 2 条相关
- RTX 5090+5060Ti极限跑2.4T模型,实测0.8 tok/s — mossy_troll_84 · 2026-08-14
- 5 张显卡也带不动:实测本地运行 Qwen 2.4T 量化版 — klicker0 · 2026-08-14