RTX 2080 Ti 跑 Qwen3.6-35B 编码实测:MoE 扩张路由微升 1.2 分

Specific-Tax-6700 · reddit · 2026-10-07

作者在单张 RTX 2080 Ti 22GB 上用 Unsloth UD-IQ4XS 动态 4-bit 量化(全模型驻留显存、无 offload)跑 Qwen3.6-35B-A3B,原版 HumanEval 全 164 题 pass@1 达 89.6%。

随后做了对照实验:自研的「MoE expansion」推理期路由补丁——不重训、不改文件,把第 25–39 层每 token 激活专家数从默认 top-8 提到 20(带自适应阈值,简单 token 少激活几个),相当于每个 token 咨询更多网络容量。结果 90.9%(多解 2 题),代价是解码速度 -19%(69→56 tok/s)。此前该技巧在 Q8 精度下也曾把 GPQA-Diamond 从 81.82% 提到 84.34%。

作者诚实列出局限:164 题上 +2 在统计噪声内,只能读作「持平或略优」;用的是原版 HumanEval 测试而非 EvalPlus+,不能与 EvalPlus 榜单直接对比;且为贪心单采样协议。

配套开源了 AgrillaMoE(基于 llama.cpp 的专用服务器):自动检测 VRAM 并下载合适量化、默认启用 expansion 配置(可覆盖)、同时暴露 OpenAI 与 Anthropic 兼容 API(Claude Code 开箱即用),支持 NVIDIA GTX 10xx 到 RTX 50xx、AMD Vulkan 和 Apple Silicon Metal。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →