16GB 显存跑 35B MoE:fork llama.cpp 实现 experts 扩容提速至 60 tok/s

Specific-Tax-6700 · reddit · 2026-10-05

作者将 llama.cpp server fork 成针对 Qwen3.6-35B-A3B 的专用推理引擎 AgrillaMoE,配合 Unsloth 量化,在租用的 16GB V100 上以 2-bit UD-Q2KXL 量化跑到约 57-60 tok/s,同时支持 OpenAI 和 Anthropic 两种 API,可直接接 Claude Code。

核心技术是“MoE expansion”:Qwen3.6-35B-A3B 每个 token 只激活 8 个路由专家,该补丁在运行时把专家预算提高(如 --moe-experts 20),用自适应阈值保留概率不小于 0.8×第 8 名的专家,作用于第 25-39 层——不训练、不改权重文件,只是让每个 token 查询更多 35B 参数。效果上 GPQA-Diamond 从原版 top-8 的 81.82% 提升到 84.34%(+2.5 分)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →