Reddit 呼吁 llama.cpp 实现 MoE「热专家重载」提速本地推理

perelmanych · reddit · 2026-09-12

Reddit 用户向 llama.cpp 维护者请愿实现 Hot Expert Reload(GPU 上的热专家重载)功能:在单张 3090 上,对激活参数中等的 MoE 模型(如 Qwen3.8-Flash-Next、DeepSeek V4/V4.1 Flash、GLM 5.3 Flash)解码速度将显著提升;双 3090 下速度接近全量显存卸载。作者认为这将让这些准 SOTA 模型真正可本地使用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →