GLM-5.3 量化版塞进 8 张 RTX Pro 6000,峰值解码 486 tok/s
TheZachMueller · x · 2026-09-30
kaine 分享了 GLM-5.3 的 NVFP4 量化部署实测:单节点 8 张 RTX Pro 6000 即可装下,nvidia 版量化实现 54 tok/s 解码、251k 上下文、峰值 476 tok/s;采用 DFlash2 的 incoai 版量化则达 93 tok/s 解码、123k 上下文、峰值 486 tok/s。Zach Mueller 补充讨论指出,NVLink 带宽瓶颈更多出现在训练而非推理场景。这展示了前沿大模型量化后可在消费级/工作站级硬件上跑出可用吞吐。
「Infra」频道最新
- Cloudflare 开启 Monetization Gateway 测试,用 HTTP 402 向 AI 智能体收费 — michellechen · 2026-09-30
- Cloudflare 推出 Workers Issues:生产报错自动推送给编码 Agent — ritakozlov · 2026-09-30
- Synopsys 与亚马逊签 10 亿美元 IP 协议,Agentic EDA 成芯片设计新收入层 — BenBajarin · 2026-09-30
- Databricks Lakebase Search 正式 GA:向量检索与 BM25 全文搜索上线 — Wise_Ear_4064 · 2026-09-30
- 英国 AISI 实测:AI 自主网络攻击一次成本可低至 1.19 美元 — OmarUFlorez · 2026-09-30
- 光智科技据称获全球大客户 6 英寸磷化铟衬底订单 — zephyr_z9 · 2026-09-30