llama.cpp 修复GPU全卸载下CPU单核100%占用Bug

MelodicRecognition7 · reddit · 2026-08-19

Reddit 用户分享了 llama.cpp 在将模型完全卸载到 GPU 后仍出现 CPU 单核 100% 占用的 Bug 及其修复补丁。该补丁通过设置 cudaDeviceScheduleBlockingSync 标志解决了高 CPU 占用问题(解码阶段降至 30-50%),但测试显示这会导致约 6-8% 的生成吞吐量(TPS)下降。作者呼吁社区提供更优解。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →