为何 Llama.cpp 中增大上下文反而提升了推理速度?

satnl · reddit · 2026-09-01

用户在 RX 9070 XT 上运行 Qwen 模型时发现异常:使用 131072 上下文时的推理速度(PP 778.91 t/s, TG 40.68 t/s)远快于 65536 上下文(PP 137.87 t/s, TG 13.36 t/s)。提供了详细的启动参数和日志,询问是否触犯了特定规则导致小上下文性能崩塌。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →