16GB 显存跑 35B MoE:fork llama.cpp 实现 experts 扩容提速至 60 tok/s
Specific-Tax-6700 · reddit · 2026-10-05
作者将 llama.cpp server fork 成针对 Qwen3.6-35B-A3B 的专用推理引擎 AgrillaMoE,配合 Unsloth 量化,在租用的 16GB V100 上以 2-bit UD-Q2KXL 量化跑到约 57-60 tok/s,同时支持 OpenAI 和 Anthropic 两种 API,可直接接 Claude Code。
核心技术是“MoE expansion”:Qwen3.6-35B-A3B 每个 token 只激活 8 个路由专家,该补丁在运行时把专家预算提高(如 --moe-experts 20),用自适应阈值保留概率不小于 0.8×第 8 名的专家,作用于第 25-39 层——不训练、不改权重文件,只是让每个 token 查询更多 35B 参数。效果上 GPQA-Diamond 从原版 top-8 的 81.82% 提升到 84.34%(+2.5 分)。
「Infra」频道最新
- 一条 USB-C 线把 iPhone 变 24GB MacBook 副显卡,跑 Qwen 27B 快 40% — TheMoonMidas · 2026-10-05
- Hugging Face Accelerate 前负责人亮履历,回应本地 AI 质疑 — TheZachMueller · 2026-10-05
- 算力交易员亲历:买方只认 NVIDIA,CUDA 护城河依然稳固 — sudoraohacker · 2026-10-05
- 美光 CEO:2027-2028 年内存供应将比 2026 年更紧张 — chillinewman · 2026-10-05
- 2.6B 竟胜 2B:LFM2.5 速度更快、内存省 1.3GB 实测对比 MiniCPM5 — parepeg · 2026-10-05
- 独立开发者省钱组合:Firebase+Cloudflare R2+Vercel 最便宜 — jdluk87 · 2026-10-05