llama.cpp 的预填充阶段竟然没吃满 CPU 和带宽

Dependent_Ad948 · reddit · 2026-07-30

llama.cpp 的 prompt processing 看起来没吃满 CPU 和内存带宽

作者在主线 llama.cpp 上做 CPU-only 实验时发现,prompt processing(prefill)和 token 生成的表现差异很大。

观察到的现象

在一台 Xeon Ice Lake 机器上,配有 24 个物理核心和 8 通道内存:

作者给出的数据大致是:

想弄明白什么

作者并不是在抱怨速度慢,而是想理解为什么 prefill 会明显没有吃满可用的 CPU 与内存带宽,尤其是在部分层从 GPU offload 到 CPU 的情况下。他希望知道自己忽略了哪些关键机制,或者还可以从哪些参数和架构理解这种差异。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →