RTX 3050 6GB 跑 Qwen 30B MoE:90k 上下文 30+ tps
Bakkario · reddit · 2026-08-14
Reddit 用户 Bakkario 分享在 RTX 3050 6GB 显卡上运行 Qwen 30B MoE 模型的经验。此前在 22GB DDR4 内存下只能获得 10 tps 以下的速度,但通过更换推理框架(harness),在 90k 上下文下达到了 20-25 tps,甚至 30-35 tps。作者表示将补充更多细节,并鼓励其他低配置用户分享优化经验。
「Infra」频道最新
- 开发者急寻超 1MW 算力资源 — isidentical · 2026-08-14
- YC 孵化 Marengo:用自动化将数据中心设计周期减半 — ycombinator · 2026-08-14
- TPN Labs 推出去中心化算力主网竞赛,攻坚端侧 AI 模型 — const_reborn · 2026-08-14
- 新型类脑 AI 芯片:运算量仅需万分之一即可实现瞬时控制 — ChuckDBrooks · 2026-08-14
- Architect Labs用AI设计芯片,让公司无需自建半导体团队 — hsu_byron · 2026-08-14
- Minimax 模型配合 ref2va 量化,低显存也能跑 — Actual-Project358 · 2026-08-14