RTX 3050 6GB 跑 Qwen 30B MoE:90k 上下文 30+ tps

Bakkario · reddit · 2026-08-14

Reddit 用户 Bakkario 分享在 RTX 3050 6GB 显卡上运行 Qwen 30B MoE 模型的经验。此前在 22GB DDR4 内存下只能获得 10 tps 以下的速度,但通过更换推理框架(harness),在 90k 上下文下达到了 20-25 tps,甚至 30-35 tps。作者表示将补充更多细节,并鼓励其他低配置用户分享优化经验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →