开源推理引擎 Strata:12GB VRAM 跑 125B MoE 模型,可达 93 tokens/s
udmrzn · x · 2026-10-03
开源推理引擎 Strata 通过 GPU/CPU 分工 + 分层存储,让 125B 级 MoE 模型(如 Qwen3.8-Flash-Next)在 RTX 5070 12GB 这类消费级 GPU 上本地运行。
核心机制:
- 不把整个模型读入 VRAM:GPU 放 Attention、Router、KV Cache 和高频 Expert,其余 Expert 留在 RAM 由 CPU 计算,SSD 放大容量 Lookup Table 按需读取
- Expert 缓存按使用情况自适应,12–16GB VRAM 即可处理超大 MoE 模型
- 利用 MTP 层做投机解码,官方称比常规生成快约 1.6–1.8 倍
性能(RTX 5070 12GB + Ryzen 5 7600 + 64GB RAM,短对话):Q20 约 93 tokens/s,IQ2XS 约 79,128K 上下文下也保持 46–74 tokens/s。推荐 12GB+ VRAM、64GB RAM、NVMe SSD,模型文件需 70–120GB 存储空间。
所属事件:开源引擎 Strata 让游戏 PC 本地跑 125B 大模型(7 条相关)→
「Infra」频道最新
- 仅 10% 人口重度用 AI 就可能压垮推理基础设施,HBM 正疯狂短缺 — XFreeze · 2026-10-03
- 网友炮轰某「Neocloud」:几个月前还在套壳 RunPod,凭何比肩 AWS — knowrohit07 · 2026-10-03
- 分析师看多 AAOI:800G 与 1.6T 爬坡,3.2T 尚未成主流 — BenBajarin · 2026-10-03
- 半年前被Google拒之门外的千元周末跑分消费,如今畅通无阻 — vivekhaldar · 2026-10-03
- AMD 官方晒账:MI355X 软件调优叠加 vLLM 升级,吐 token 成本直降 31% — ryanshrout · 2026-10-03
- 4 卡 GPU 服务器拓扑实战:一个 Gen5 Switch 就够,别多花冤枉钱 — knowrohit07 · 2026-10-03