8 张 RTX 6000 跑 GLM 5.2 实测:推理速度达 385 tok/s
max_paperclips · x · 2026-08-08
开发者成功在 8 张 RTX PRO 6000 显卡上,使用 NVFP4 量化格式运行 GLM 5.2 模型,实现了 385 tokens/s 的推理速度。
发帖人表示,初期运行时不仅存在 Bug 且速度极慢,借助 AI Agent 辅助调试耗时一周多才达成这一成绩。
「Infra」频道最新
- 马斯克旗下 SpaceX 与特斯拉拟在德州建半导体厂 — elonmusk · 2026-08-08
- 反直觉实测:MiniMax H3全量大模型比量化版更快且物理一致性更好 — Wise_Revolution385 · 2026-08-08
- 英伟达拟斥资 30 亿美元,投资黑石支持的电力公司 — pstAsiatech · 2026-08-08
- 南大等提出连续扩散语言模型 AURORA-LM,10亿参数全程基于昇腾 NPU 训练 — 机器之心 · 2026-08-08
- 实测本地视频生成:MiniMax 推理速度远逊于 LTX — PhilosopherSweaty826 · 2026-08-08
- 深度分析:中国干预美国数据中心争议的证据有多弱? — AndyMasley · 2026-08-08