GLM-5.2 在 RTX 5090 上推理提速至 80–110 tok/s
markjeffrey · x · 2026-07-27
GLM-5.2 在 RTX 5090 上推理速度提升到原来的 3 倍
一条转述帖显示,Ning 把 GLM-5.2 在 RTX 5090 上的单路推理速度从大约 30 tok/s 提升到了 80–110 tok/s,相当于一夜之间快了约 3 倍。
这更像是一次面向本地推理的性能优化,而不是新模型发布本身。
「Infra」频道最新
- Voice AI 通话真实成本不止按分钟算 — decant338 · 2026-07-27
- 美光与 Meta 白皮书称 Spark 溢写 SSD 后可慢 38 倍 — dr_alphalyrae · 2026-07-27
- AI 推理服务被指比自租 GPU 贵 7 到 15 倍 — JoshPurtell · 2026-07-27
- CUDA 基准测出 6400 万数求和快 20 倍 — ctjlewis · 2026-07-27
- AI 基建把数据中心融资逼进更复杂的资本结构 — GaryMarcus · 2026-07-27
- 有人在问:RAID 0 NVMe 组合能否提升 Pulsar 跑大模型 — Wyldkard79 · 2026-07-27