llama.cpp 补丁把 DeepSeek-V4-Flash-0731 提速到 25.91 tok/s
dyn___ · x · 2026-08-04
有人分享了自己为 DeepSeek-V4-Flash-0731 改的 llama.cpp 补丁,结果把吞吐从大约 3.26 tok/s 提升到 25.91 tok/s,同时把启动时间从 120 秒降到 17 秒。
配图里给出了测试环境和优化路径:
- 机器是 单张 RTX 3090 24GB 加老旧双路 Xeon 节点
- 优化按 commit 逐步推进
- 主要收益来自 fused MoE kernel、NUMA 分片、启动并行化、expert replication、核心固定 等改动
作者也提到,当前瓶颈可能已经转到 llama.cpp 本身,但这台老机器的提升已经很夸张。
「Infra」频道最新
- ARC 选手称其 CUDA C 栈领先至少一个数量级 — jsuarez · 2026-08-04
- 600MB 写实 3D Gaussian splat 秒级进浏览器 — willeastcott · 2026-08-04
- AI agent 测试 5 个搜索 API:Parallel 最快,Keiro 最便宜 — Water_Law2005 · 2026-08-04
- Dwarkesh Patel 认为,更强 AI 可能把算力价格推高 10 倍 — Dwarkesh Patel · 2026-08-04
- 推理提供商显著改写 Kimi-K3 评测结果,单个 endpoint 登顶 CEO-Bench — AAAzzam · 2026-08-04
- 云厂商 AI 积压订单达 2.3 万亿,分析师警示循环融资风险 — TiernanRayTech · 2026-08-04