llama.cpp本地推理排错:TPS突然减半的坑
campaigner_ · reddit · 2026-08-02
一名开发者在使用 RTX 3070 + i7-11700 本地运行 llama.cpp 时,遭遇了推理速度(TPS)突然减半的离奇问题。
故障现象:
此前使用 Qwen 模型和 Gemma 模型均能稳定在 26-30 t/s,但近期在启动时速度直接掉到 12-13 t/s,即使将上下文大小从 131k 缩小至 32k 也无济于事。
作者附上了完整的启动参数配置(包含 --cpu-moe, --no-mmap, --chat-template-kwargs 等),寻求社区帮助以排查是否为特定参数冲突或底层更新导致的性能瓶颈。
所属事件:排查Windows系统异常致本地大模型推理降速(2 条相关)→
「Infra」频道最新
- Ibiden 的 AI 基板涨价效应,成了财报里的非对称看点 — tengyanAI · 2026-08-04
- OpenAI 和 Anthropic 股权正在抬高大科技报表利润 — Kr00ney · 2026-08-04
- Menlo 说 AI 进入第二阶段,机会在基础设施 — mmurph · 2026-08-04
- 播客称 AI CapEx、算力紧缺正挤压半导体链条 — BenBajarin · 2026-08-04
- MiniMax H3 开权重本地跑,L40S 上把 32 分钟压到 7.2 分钟 — ashishsanu · 2026-08-04
- Fluidstack 将 AI 基础设施晚宴带到奥斯汀并继续招聘 — MxMnr · 2026-08-04