实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行
tokenbender · x · 2026-08-10
开发者 @tokenbender 分享了其在本地大模型推理优化上的最新测试结果。通过使用调整过的量化(tuned quants)和 dflash 技术,Muse Glimmer 30B 模型达到了 114 tokens/s 的推理速度。
这一进展让他有信心进一步剥离模型的智能体能力,使其最终能够在显存不足 16G 的消费级硬件上流畅运行。
「Infra」频道最新
- AMD收购初创公司,将AI权重烧录进芯片打造只读模型 — lemire · 2026-08-10
- llama.cpp首发支持Muse Glimmer模型 — jacek2023 · 2026-08-10
- 英特尔拟发行150亿美元股票,押注AI算力需求 — ryanshrout · 2026-08-10
- 云端大模型+本地小模型混合架构潜力大,Muse Spark 1.2即将开源 — jack_w_rae · 2026-08-10
- DeepSeek API日耗仅1.14美元,自购双DGX回本需24年 — delduca · 2026-08-10
- 算力之后的新瓶颈:AI 数据中心面临电力短缺挑战 — ingliguori · 2026-08-10