bitsandbytes 作者预告新量化方法:GLM 5.3 单卡 DGX Spark 跑 7t/s

rerri · reddit · 2026-08-14

bitsandbytes 作者 Tim Dettmers 预告一种新的量化方法,声称可在单个 DGX Spark 上以 7 tokens/s 的速度运行 GLM 5.3。但发帖者提醒不要过度兴奋,因为此前有大量量化方案承诺很好但最终未能实现。不过 Tim Dettmers 是知名研究者,或许这次会有所突破。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →