RTX 5090本地跑GLM-5.2与Kimi K3:速度可达129 tok/s
markjeffrey · x · 2026-07-31
推友分享了一项基于半价 RTX 5090 消费级配置的本地推理实测数据。
- GLM-5.2:解码速度达到 129 tok/s。
- Kimi K3:解码速度达到 108 tok/s。
- 背景对比:该测试回应了此前 tinygrad 团队使用 AMD 设备实现 120 tok/s GLM-5.2 的前沿部署方案,证明了消费级显卡在运行大模型方面具备极高性价比。
「Infra」频道最新
- 单节点跑通 Inkling Small:500ms 内实现原生语音交互 — andimarafioti · 2026-07-31
- 大模型推理成本骤降:4个月Token价格缩水至十三分之一 — charliermarsh · 2026-07-31
- 三星财报:Agentic AI 带动企业级 SSD 需求激增 — davidyin44 · 2026-07-31
- vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑 — vllm_project · 2026-07-31
- 马来西亚居民抗议成功,逼停当地数据中心建设 — im_mansigupta · 2026-07-31
- Meta AI基础设施租赁义务三个月激增53%,总额近2790亿美元 — Polymarket · 2026-07-31