llama.cpp 深度调优:异构 GPU 提升 70% 生成速度与长文本实测

fintip · reddit · 2026-08-20

作者在 4090 笔记本 + 7900 XTX 外接显卡的 40GB 显存异构环境下,经过 3 天基准测试,通过调整参数将生成速度从 16t/s 提升至 27t/s,可用上下文扩展至 262k。关键发现包括:启用 speculative decoding (MTP + ngram) 显著提升生成速度;7900 XTX 在解码任务上表现优异;TB4 带宽损耗低于预期;并发现了 llama.cpp 在多 GPU MTP 模式下的 bug 并已提交。提供了最终的优化启动命令。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →