两张老 V100 本地跑 321B GLM-5.3-Flash:开源 Project Maya 实测 40 token/s
lxfater · x · 2026-10-07
开源项目 Project Maya 让 3210 亿参数的 GLM-5.3-Flash(MoE,每 token 激活约 18B,上下文最高 1M)在消费级硬件上本地运行:
- 作者 lxfater 实测配置:2 张 V100 32GB + 约 32GB 内存 + NVMe SSD,生成速度最高 40 token/s
- 原理:常用专家放入显存,其余分散到内存和 SSD 按需调入;默认使用约 90GB 的 Maya-S 量化模型
- 自带网页聊天与图片理解,兼容 OpenAI / Anthropic API,可接入编程 Agent,全程本地运行
- 基于 Strata 引擎改造适配 GLM(此前 Strata 已可在 12GB 显存 + 64GB 内存跑千问千亿模型)
- 目前仅支持 Linux,Windows/WSL2 暂不支持,MIT 协议开源
对于手上有老卡、想本地跑大模型的用户是个实用选择。
「Infra」频道最新
- Lambda 拟融资 40 亿美元估值 145 亿,2027 年冲刺 IPO — darian314 · 2026-10-08
- Strata 0.1.40.1 空置 10.7GB 显存不是 bug:少缓存 24% 冷专家反提速 — Critical-Entry3377 · 2026-10-07
- 开发 8 年的 Python 框架 Flama 2.0:把 LLM 打包成单一文件多协议对外服务 — p3rdy · 2026-10-07
- FastH3 V2 单张 RTX 5090 生成 5 秒带音频视频仅需 15 秒 — NVIDIAAI · 2026-10-07
- PyTorch 新文档揭 Grace 架构 .cpu() 隐性瓶颈:复用 pinned 缓冲区 — StasBekman · 2026-10-07
- AWS 用 Lambda Durable Functions 实现事件自动修复流水线 — AWS ML Blog · 2026-10-07