为何 Llama.cpp 中增大上下文反而提升了推理速度?
satnl · reddit · 2026-09-01
用户在 RX 9070 XT 上运行 Qwen 模型时发现异常:使用 131072 上下文时的推理速度(PP 778.91 t/s, TG 40.68 t/s)远快于 65536 上下文(PP 137.87 t/s, TG 13.36 t/s)。提供了详细的启动参数和日志,询问是否触犯了特定规则导致小上下文性能崩塌。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- Linux 内核更新,Mac 可通过 USB-C 直连 Linux — No-Name-Person111 · 2026-09-01