llama.cpp 在 GPU offloading 的 MoE 测试里,E 核比 P 核更快
dir3ctly · reddit · 2026-07-25
- 作者在一套混合架构的 Intel CPU + RTX 5090 机器上测试 llama.cpp,重点观察 CPU pinning 和 GPU/CPU offloading 对大模型推理吞吐的影响。
- 他的实测结果很反直觉:只用 E 核反而更快。
- 0–23 核全开:19.8 tok/s
- 仅 E 核(12–23):22.7 tok/s
- P 核 + 部分 E 核(0–11):15.6 tok/s
- 帖主想弄清楚为什么 P 核参与后性能下降,认为瓶颈可能在内存带宽,并补充了 Docker cpuset-cpus、CUDA 13、Qwen 3.5 122B A10B、长上下文等测试条件。
- 这是一条很典型的本地推理调优/排障讨论,核心价值在于 heterogeneous CPU 行为和 offloading 实测。
「Infra」频道最新
- 不同推理厂商各有 SLA 侧重,Together/Modal/Fireworks/Cerebras 值得关注 — abhijithneil · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11