硬核实测本地运行 2.4T Qwen 模型

多位硬核开发者尝试在消费级硬件上运行参数量高达 2.4T 的 Qwen3.8-2.4T-A95B 模型极限量化版。测试者使用了包括双 RTX 5090 与三 RTX 5060Ti 在内的五张显卡来运行体积达 397GB 的模型,实测生成速度约为 0.8 tok/s。这表明即便使用高端消费级显卡阵列,本地运行超大规模模型依然面临严峻的性能挑战。

2026-08-14 ~ 2026-08-14 · 2 条相关