llama.cpp 深度调优:异构 GPU 提升 70% 生成速度与长文本实测
fintip · reddit · 2026-08-20
作者在 4090 笔记本 + 7900 XTX 外接显卡的 40GB 显存异构环境下,经过 3 天基准测试,通过调整参数将生成速度从 16t/s 提升至 27t/s,可用上下文扩展至 262k。关键发现包括:启用 speculative decoding (MTP + ngram) 显著提升生成速度;7900 XTX 在解码任务上表现优异;TB4 带宽损耗低于预期;并发现了 llama.cpp 在多 GPU MTP 模式下的 bug 并已提交。提供了最终的优化启动命令。
「Infra」频道最新
- Omarchy 与 Linux 桌面:AI 助力的机遇 — antirez · 2026-08-20
- 微软将 TypeScript 主仓库从 TS 迁移至 Go — wateriscoding · 2026-08-20
- 投资人套用芒格「三筐」框架:数据中心稳进 yes 筐 — RachelVT42 · 2026-08-20
- 实测 FP8 比 GGUF 快 5 倍,GGUF 还有什么用? — ROBOTTTTT13 · 2026-08-20
- 用 MiniMax H3 加 Qwen 图像编辑复刻福尔摩斯短片,3090 上 10 秒一帧 — nikhilprasanth · 2026-08-20
- 运维事故:在线 Ceph 集群重设计存储布局引切尔诺贝利玩笑 — l4rz · 2026-08-20