GLM-5.2本地跑出180 tok/s,端侧推理潜力巨大

SIGKITTEN · x · 2026-08-08

开发者分享了在本地设备上运行 GLM-5.2 模型的实测数据,其推理速度高达 180 tokens/s。这表明通过极致的系统优化,当前 GPU 在端侧大模型部署上仍有极大的性能压榨空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →