llama.cpp 新 PR:MoE 专家留主机内存,GPU 缓存大幅提速
jacek2023 · reddit · 2026-10-08
llama.cpp 合并中的 PR #29887 由 am17an 提交,为驻留在主机内存中的 MoE 专家权重增加 GPU 缓存。对于无法完全装入显存的 MoE 模型,这一改动可能带来显著推理加速,降低了大模型本地部署的显存门槛。
「Infra」频道最新
- GitHub Copilot 可将任务交给本地模型 MAI-Code-1.1 Flash — mariorod1 · 2026-10-08
- 微软联合 Nvidia 推 Surface Spark:128GB 内存售价 6000 美元 — casper_hansen_ · 2026-10-08
- Google 发射首颗搭载 4 颗 TPU 的测试卫星,推进太空算力计划 — CurieuxExplorer · 2026-10-08
- GPU 租赁平台 Lium:出租率创新高,闲置 GPU 也有保底收益 — const_reborn · 2026-10-08
- MRVL 揭与谷歌芯片协议:推理加速器最高 1200 亿美元,TPU 旁的解码芯片成关键 — demian_ai · 2026-10-08
- llama.cpp 登上微软 Windows 发布会大屏,作者ggerganov感慨软硬栈合流 — ggerganov · 2026-10-08