Project Maya 让 321B GLM-5.3-Flash 跑在单张消费级 GPU 上
inthesearchof · reddit · 2026-10-12
Project Maya 开源(GitHub 已 365 星),可在自有 GPU 上本地运行智谱开源的 GLM-5.3-Flash(321B 参数 MoE、约 18B 激活、1M 上下文、MIT 协议),构建于 Strata 之上。
- 分层卸载:常用专家放 GPU,次级放内存,其余放 NVMe SSD,边聊边调度
- 自动调优:实测 GPU/CPU/RAM/SSD 后自动适配,支持 1–16 张 NVIDIA 卡,AMD 与 Windows 实验性支持
- 速度:4×RTX 4090 达 118 tok/s,单张 RTX 5090 约 30+ tok/s
- 质量:自有量化保留 FP8 模型 97.7–99.2% 的零样本准确率
- 易接入:提供 OpenAI/Anthropic 兼容 API 与工具调用,可直接接入编码 agent,自带浏览器聊天与监控面板
发帖人实测从 10 tok/s 提升到 30 tok/s,认为低量化下 GLM-5.3 体验优于 Qwen 3.8 Flash Next。
「Infra」频道最新
- zml_ai 编译优化:模型冷启动从 45 分钟缩至 3 分钟 — steren · 2026-10-12
- 本地大模型推理正走向多卡并行,GPU 互联带宽成关键变量 — Dathide · 2026-10-12
- 16GB 显存本地部署选型:模型、推理优化与新推理服务器三线演进 — ECrispy · 2026-10-12
- 一张用量截图晒出 1100+ 台云虚拟机,最大单账户建了 738 台 — aniketmaurya · 2026-10-12
- AMD Strix Halo 本地跑 AI 写规格:qwen 慢 5-10 倍但活真能干完 — julianharris · 2026-10-12
- JAX 可跑 Apple GPU:jax-graft 用 Opus 5.5 写成开源后端 — twiecki · 2026-10-12