RTX 3090 本地跑 35B 模型:调优 MoE 卸载让处理速度飙升 2.36 倍
Longjumping-Music638 · reddit · 2026-08-06
一位开发者在 RTX 3090 (24GB) 上运行 Qwen3.6-35B-A3B Q6 模型时,通过将部分 MoE 专家层卸载至 CPU,成功释放了显存。这使得批处理量得以从 512 提升至 1024,在保持生成速度基本不变的情况下,将提示词处理速度从 564 tok/s 暴力提升至 1330 tok/s,实现了 2.36 倍的性能飞跃。
作者不仅提供了完整的 llama-bench 复现代码和软硬件环境配置,还透露他使用进化搜索算法(LEVI)自动寻找最优的推理参数。他目前正呼吁社区提供更多不同硬件配置的测试数据,以验证该优化策略的普适性。
「Infra」频道最新
- 将Rust编译器提速3倍,每年可节省数亿美元算力 — doodlestein · 2026-08-06
- Alphabet 年内已募资超 1500 亿美元,正寻求 250 亿新债 — firstadopter · 2026-08-06
- 黄仁勋谈算法即资产,太空算力创企 Starcloud 估值破十亿 — santoshpanda · 2026-08-06
- Hugging Face 单周新增近 4PB 数据,AI 正把人类当存储层 — vanstriendaniel · 2026-08-06
- 单张 RTX 3090 跑 128K 上下文,DeepSeek 推理优化实测 — Ok_Ninja7526 · 2026-08-06
- 单GPU跑多模型:开源推理引擎SIE让自托管降本75% — Roger_M_Taylor · 2026-08-06