反直觉现象:llama.cpp 更长上下文反而 prefill 更快
Ekepa · reddit · 2026-09-11
一位本地部署用户在 llama.cpp(RX 6600 XT 8GB,Vulkan,43/43 层全 offload)上发现 prefill 速度并非随上下文长度单调下降:935→318 tok/s(1018–8151)后出现非单调段——16302 上下文反而比 8151 快(472 vs 318 tok/s),且 130416 上下文(89.7 tok/s)比 65208(76.7 tok/s)快,尽管处理两倍 token。多次运行间差异 <2%,排除单次采样噪声,异常稳定复现。作者尚不知原因,求助社区解释。
「Infra」频道最新
- NVIDIA BioNeMo 推理运行时开公测:CUDA 内核加速蛋白质结构预测 — AllThingsApx · 2026-09-11
- NVIDIA 开源 BioNeMo 推理运行时,蛋白结构预测吞吐提升 2.9 倍 — AllThingsApx · 2026-09-11
- NVIDIA BioNeMo 推理运行时开启公测,Boltz-2 等模型推理提速 — AllThingsApx · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11
- NVIDIA 单季数据中心营收 890 亿美元,算力不能再当 IT 开支看 — PeterDiamandis · 2026-09-11
- 实验室 Xeon 跑 DeepSeek V4.1,CPU 纯 CPU 推理项目开源 — Qwen30bEnjoyer · 2026-09-11