llama.cpp本地推理排错:TPS突然减半的坑

campaigner_ · reddit · 2026-08-02

一名开发者在使用 RTX 3070 + i7-11700 本地运行 llama.cpp 时,遭遇了推理速度(TPS)突然减半的离奇问题。

故障现象:

此前使用 Qwen 模型和 Gemma 模型均能稳定在 26-30 t/s,但近期在启动时速度直接掉到 12-13 t/s,即使将上下文大小从 131k 缩小至 32k 也无济于事。

作者附上了完整的启动参数配置(包含 --cpu-moe, --no-mmap, --chat-template-kwargs 等),寻求社区帮助以排查是否为特定参数冲突或底层更新导致的性能瓶颈。

所属事件:排查Windows系统异常致本地大模型推理降速(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →