实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行

tokenbender · x · 2026-08-10

开发者 @tokenbender 分享了其在本地大模型推理优化上的最新测试结果。通过使用调整过的量化(tuned quants)和 dflash 技术,Muse Glimmer 30B 模型达到了 114 tokens/s 的推理速度。

这一进展让他有信心进一步剥离模型的智能体能力,使其最终能够在显存不足 16G 的消费级硬件上流畅运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →