反直觉现象:llama.cpp 更长上下文反而 prefill 更快

Ekepa · reddit · 2026-09-11

一位本地部署用户在 llama.cpp(RX 6600 XT 8GB,Vulkan,43/43 层全 offload)上发现 prefill 速度并非随上下文长度单调下降:935→318 tok/s(1018–8151)后出现非单调段——16302 上下文反而比 8151 快(472 vs 318 tok/s),且 130416 上下文(89.7 tok/s)比 65208(76.7 tok/s)快,尽管处理两倍 token。多次运行间差异 <2%,排除单次采样噪声,异常稳定复现。作者尚不知原因,求助社区解释。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →