llama.cpp 修复GPU全卸载下CPU单核100%占用Bug
MelodicRecognition7 · reddit · 2026-08-19
Reddit 用户分享了 llama.cpp 在将模型完全卸载到 GPU 后仍出现 CPU 单核 100% 占用的 Bug 及其修复补丁。该补丁通过设置 cudaDeviceScheduleBlockingSync 标志解决了高 CPU 占用问题(解码阶段降至 30-50%),但测试显示这会导致约 6-8% 的生成吞吐量(TPS)下降。作者呼吁社区提供更优解。
「Infra」频道最新
- Crusoe 发布集成指南:Cursor 等工具接 GLM/DeepSeek — darian314 · 2026-08-19
- Polymarket 预测:年底前某州实施数据中心禁令概率 67% — Polymarket · 2026-08-19
- 只需最小化窗口,ComfyUI 生成提速 15-20% — dota2portaltv · 2026-08-19
- 企业为何需要 AI 模型路由:韧性优于成本优化 — mattturck · 2026-08-19
- 美光 CEO 称客户头号约束已非电力,而是 DRAM — Beth_Kindig · 2026-08-19
- 六大资管巨头联手英伟达,超5000亿美元算力融资平台落地 — JOBhakdi · 2026-08-19