8 张 RTX 6000 跑 GLM 5.2 实测:推理速度达 385 tok/s

max_paperclips · x · 2026-08-08

开发者成功在 8 张 RTX PRO 6000 显卡上,使用 NVFP4 量化格式运行 GLM 5.2 模型,实现了 385 tokens/s 的推理速度。

发帖人表示,初期运行时不仅存在 Bug 且速度极慢,借助 AI Agent 辅助调试耗时一周多才达成这一成绩。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →