Project Maya 让 321B GLM-5.3-Flash 跑在单张消费级 GPU 上

inthesearchof · reddit · 2026-10-12

Project Maya 开源(GitHub 已 365 星),可在自有 GPU 上本地运行智谱开源的 GLM-5.3-Flash(321B 参数 MoE、约 18B 激活、1M 上下文、MIT 协议),构建于 Strata 之上。

发帖人实测从 10 tok/s 提升到 30 tok/s,认为低量化下 GLM-5.3 体验优于 Qwen 3.8 Flash Next。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →