Reddit 呼吁 llama.cpp 实现 MoE「热专家重载」提速本地推理
perelmanych · reddit · 2026-09-12
Reddit 用户向 llama.cpp 维护者请愿实现 Hot Expert Reload(GPU 上的热专家重载)功能:在单张 3090 上,对激活参数中等的 MoE 模型(如 Qwen3.8-Flash-Next、DeepSeek V4/V4.1 Flash、GLM 5.3 Flash)解码速度将显著提升;双 3090 下速度接近全量显存卸载。作者认为这将让这些准 SOTA 模型真正可本地使用。
「Infra」频道最新
- 热传梗图:「我们有算力」是个谎言 — julian88888888 · 2026-09-12
- 测算:开源模型仅占全球 AI 训练支出的约 3.2% — 0xBekket · 2026-09-12
- OpenAI CFO:人人都抢 GPU,却没料到 agentic AI 会激活 CPU — rohanpaul_ai · 2026-09-12
- OpenAI CFO:大家追 GPU,Agentic AI 将让 CPU 重新成为焦点 — rohanpaul_ai · 2026-09-12
- 512GB DDR4 + 双 RTX 3090 该跑什么本地模型? — ArtifartX · 2026-09-12
- Meta 给每个用户白送 2 vCPU 虚拟机,免费算力门槛让 OpenAI 都难跟进 — signulll · 2026-09-12