RTX 3090 本地跑 35B 模型:调优 MoE 卸载让处理速度飙升 2.36 倍

Longjumping-Music638 · reddit · 2026-08-06

一位开发者在 RTX 3090 (24GB) 上运行 Qwen3.6-35B-A3B Q6 模型时,通过将部分 MoE 专家层卸载至 CPU,成功释放了显存。这使得批处理量得以从 512 提升至 1024,在保持生成速度基本不变的情况下,将提示词处理速度从 564 tok/s 暴力提升至 1330 tok/s,实现了 2.36 倍的性能飞跃。

作者不仅提供了完整的 llama-bench 复现代码和软硬件环境配置,还透露他使用进化搜索算法(LEVI)自动寻找最优的推理参数。他目前正呼吁社区提供更多不同硬件配置的测试数据,以验证该优化策略的普适性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →