397B MoE 现在能单卡 RTX PRO 6000 跑起来
mrstoatey · reddit · 2026-07-27
这是一个面向 MoE 大模型流式推理 的运行时 Krasis 的实测更新,重点是:Ornith-1.0-397B 现在可以在单张 RTX PRO 6000 Blackwell 96GB 上交互运行。
实测数据
- 10,000 tokens 的 prefill:1,346.3 tok/s,约 7.43 秒
- 39,920 tokens 的 prefill:2,354.5 tok/s,约 16.95 秒
- decode:
- 50 tokens:23.58 tok/s
- 100 tokens:21.85 tok/s
- 250 tokens:20.40 tok/s 持续输出
- 开启 Adaptive Cold Mass Pruning 后,50 token decode 提升到 25.73 tok/s,平均只跳过约 1.8% 的 routed probability mass
运行方式
- 这个 runtime 会把 experts 放在 CPU RAM 里,再按需动态搬到 VRAM
- 本次运行中,大约 43% 的 routed experts 常驻显存
- 进程峰值内存约 202GB,作者认为 256GB RAM 的消费级 DDR5 主板也有机会跑起来
额外观察
- 更小的 MoE 如果能完全装进系统内存,速度会更高,比如 35B 级模型在 5090 上可到约 117 tok/s decode
- 甚至 RTX 5090 32GB 也能跑同一 397B 模型,只是 decode 约 7.9 tok/s,适合愿意等的人
「Infra」频道最新
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- 从燃气到吉瓦:Diligence Stack 专家访谈拆解 AI 数据中心供电难题 — BenBajarin · 2026-09-23
- GPT-6 Sol 与 Luna 价格砍半,智能指数持平前代 — ArtificialAnlys · 2026-09-23