GLM-5.2本地跑出180 tok/s,端侧推理潜力巨大
SIGKITTEN · x · 2026-08-08
开发者分享了在本地设备上运行 GLM-5.2 模型的实测数据,其推理速度高达 180 tokens/s。这表明通过极致的系统优化,当前 GPU 在端侧大模型部署上仍有极大的性能压榨空间。
「Infra」频道最新
- RTX 5090 跑 Qwen 3.6 27B 实测:262k 上下文速度达 40 t/s — Gargle-Loaf-Spunk · 2026-08-08
- Red Hat 发布 DSpark 新模型,vLLM 推理速度飙升 4 倍 — vllm_project · 2026-08-08
- Together AI 发布交互式图表,图解大模型量化与推理原理 — zainhas · 2026-08-08
- Nscale 传 IPO 前宣称获 510 亿美元合同收入,遭业内质疑 — nathanbenaich · 2026-08-08
- vLLM 联合英伟达优化,在 GB200 上实现 Qwen3.5 推理超 2.5 万 TPS — AccBalanced · 2026-08-08
- Baseten 推理工程大师课:如何将大模型权重转化为生产级应用 — yenkel · 2026-08-08