单张 RTX 3090 跑 128K 上下文,DeepSeek 推理优化实测
Ok_Ninja7526 · reddit · 2026-08-06
一位开发者在 Reddit 分享了在单张 RTX 3090 (24GB) 上针对 DeepSeek-V4-Flash-0731 GGUF 模型的极限优化实测,硬性指标为必须保持 128,000 token 的上下文窗口。
实验基于 llama.cpp 后端,通过调整 GPU offloading、CPU 专家放置、KV-cache 量化和 batch sizes 等参数,对比了四种不同量化版本的吞吐表现与内存占用:
- UD-IQ4XS: 生成速度约 9.9 tok/s,系统内存和显存逼近极限。
- UD-IQ3S: 生成速度约 12.1 tok/s,较 IQ4XS 提速 22%,内存占用降低约 17GB。
- UD-IQ3XXS: 生成速度约 12.5 tok/s,相比 IQ3S 仅小幅提升。
作者详细列出了各项硬件指标(如 AMD Ryzen 9 9900X + 128GB DDR5 内存)和具体的软件配置参数,为本地端侧部署超长上下文模型提供了极具参考价值的工程数据。
「Infra」频道最新
- 将Rust编译器提速3倍,每年可节省数亿美元算力 — doodlestein · 2026-08-06
- Alphabet 年内已募资超 1500 亿美元,正寻求 250 亿新债 — firstadopter · 2026-08-06
- RTX 3090 本地跑 35B 模型:调优 MoE 卸载让处理速度飙升 2.36 倍 — Longjumping-Music638 · 2026-08-06
- 黄仁勋谈算法即资产,太空算力创企 Starcloud 估值破十亿 — santoshpanda · 2026-08-06
- Hugging Face 单周新增近 4PB 数据,AI 正把人类当存储层 — vanstriendaniel · 2026-08-06
- 单GPU跑多模型:开源推理引擎SIE让自托管降本75% — Roger_M_Taylor · 2026-08-06