397B MoE 现在能单卡 RTX PRO 6000 跑起来
mrstoatey · reddit · 2026-07-27
这是一个面向 MoE 大模型流式推理 的运行时 Krasis 的实测更新,重点是:Ornith-1.0-397B 现在可以在单张 RTX PRO 6000 Blackwell 96GB 上交互运行。
实测数据
- 10,000 tokens 的 prefill:1,346.3 tok/s,约 7.43 秒
- 39,920 tokens 的 prefill:2,354.5 tok/s,约 16.95 秒
- decode:
- 50 tokens:23.58 tok/s
- 100 tokens:21.85 tok/s
- 250 tokens:20.40 tok/s 持续输出
- 开启 Adaptive Cold Mass Pruning 后,50 token decode 提升到 25.73 tok/s,平均只跳过约 1.8% 的 routed probability mass
运行方式
- 这个 runtime 会把 experts 放在 CPU RAM 里,再按需动态搬到 VRAM
- 本次运行中,大约 43% 的 routed experts 常驻显存
- 进程峰值内存约 202GB,作者认为 256GB RAM 的消费级 DDR5 主板也有机会跑起来
额外观察
- 更小的 MoE 如果能完全装进系统内存,速度会更高,比如 35B 级模型在 5090 上可到约 117 tok/s decode
- 甚至 RTX 5090 32GB 也能跑同一 397B 模型,只是 decode 约 7.9 tok/s,适合愿意等的人
「Infra」频道最新
- RTX 5090 在欧洲又涨 €1,061,本地推理需求仍在推高价格 — egudegi · 2026-07-28
- GitHub 仓库每日更新 OpenAI GPTBot 等主要云与爬虫 IP 段 — tom_doerr · 2026-07-28
- 美国最大电网拟要求数据中心全额承担用电成本 — pstAsiatech · 2026-07-28
- 一条反击:数据中心债务并不是新次贷危机 — JOBhakdi · 2026-07-28
- Nvidia 德州数据中心 15 年租约为 196 亿美元 — firstadopter · 2026-07-28
- 分析师称 Google 到 2028 年离不开 Intel 供给 — zephyr_z9 · 2026-07-28