双 3090+老 EPYC 跑 177B MoE 模型:38 tok/s 仅花 800 美元
ludos1978 · reddit · 2026-09-13
楼主分享了本地运行 Qwen3-Flash-Next(177B 总参数/6B 激活 MoE,IQ4XS 量化)的硬件方案与实测数据:
- 配置:EPYC 7551(Zen1,32c/64T)+ Supermicro H11SSL-i + 128GB DDR4-2133 八通道 + 2×RTX 3090(48GB)+ 1500W 电源
- 跑法:llama.cpp,专家权重放系统内存,热点专家缓存进显存
- 性能:单请求 38 tok/s;两个并行请求各降至 4 tok/s
楼主还有 $800 预算,纠结是加第三张 3090 还是升级 Zen2 EPYC(同插槽可换),并求证加内存/更快内存的实际收益,目标是多 agent 并行时保住速度。
「Infra」频道最新
- 拿到 2×A100 三个月算力,团队公开端侧蒸馏双项目方案求拍砖 — Lerok-Persea · 2026-09-13
- 预测:2027 年超大规模厂商将收紧 AI 资本开支 — pdamodaran · 2026-09-13
- llama.cpp 上线官网 llama.app,一条命令本地跑前沿模型 — ngxson · 2026-09-13
- M2 Ultra 本地跑 Qwen:最新 oMLX 更新带来显著提速 — Thrumpwart · 2026-09-13
- Google 搜索改写结果链接为 google.com/goto,全面反 AI 爬虫抓取 — jedisct1 · 2026-09-13
- Epoch 简报:华为难追英伟达,GPT-6 Astra 刷新多项基准纪录 — Epoch AI · 2026-09-13