单张 RTX 3090 跑 128K 上下文,DeepSeek 推理优化实测

Ok_Ninja7526 · reddit · 2026-08-06

一位开发者在 Reddit 分享了在单张 RTX 3090 (24GB) 上针对 DeepSeek-V4-Flash-0731 GGUF 模型的极限优化实测,硬性指标为必须保持 128,000 token 的上下文窗口。

实验基于 llama.cpp 后端,通过调整 GPU offloading、CPU 专家放置、KV-cache 量化和 batch sizes 等参数,对比了四种不同量化版本的吞吐表现与内存占用:

作者详细列出了各项硬件指标(如 AMD Ryzen 9 9900X + 128GB DDR5 内存)和具体的软件配置参数,为本地端侧部署超长上下文模型提供了极具参考价值的工程数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →