llama.cpp 补丁把 DeepSeek-V4-Flash-0731 提速到 25.91 tok/s

dyn___ · x · 2026-08-04

有人分享了自己为 DeepSeek-V4-Flash-0731 改的 llama.cpp 补丁,结果把吞吐从大约 3.26 tok/s 提升到 25.91 tok/s,同时把启动时间从 120 秒降到 17 秒。

配图里给出了测试环境和优化路径:

作者也提到,当前瓶颈可能已经转到 llama.cpp 本身,但这台老机器的提升已经很夸张。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →