DeepSeek V4 Flash 本地跑到百万上下文

Shoddy_Bed3240 · reddit · 2026-07-18

Reddit 用户分享了在 5090 上用 llama.cpp 跑 DeepSeek V4 Flash 的配置和实测结果,重点是把上下文拉到了 100 万 token。

他使用的是 Unsloth 提供的 GGUF 版本,并贴出了完整的 llama-server 启动参数,包括:

实测性能大致为:

作者认为速度还不如 Qwen 系列理想,但 llama.cpp 仍有优化空间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →