RTX 2080 Ti 跑 Qwen3.6-35B 编码实测:MoE 扩张路由微升 1.2 分
Specific-Tax-6700 · reddit · 2026-10-07
作者在单张 RTX 2080 Ti 22GB 上用 Unsloth UD-IQ4XS 动态 4-bit 量化(全模型驻留显存、无 offload)跑 Qwen3.6-35B-A3B,原版 HumanEval 全 164 题 pass@1 达 89.6%。
随后做了对照实验:自研的「MoE expansion」推理期路由补丁——不重训、不改文件,把第 25–39 层每 token 激活专家数从默认 top-8 提到 20(带自适应阈值,简单 token 少激活几个),相当于每个 token 咨询更多网络容量。结果 90.9%(多解 2 题),代价是解码速度 -19%(69→56 tok/s)。此前该技巧在 Q8 精度下也曾把 GPQA-Diamond 从 81.82% 提到 84.34%。
作者诚实列出局限:164 题上 +2 在统计噪声内,只能读作「持平或略优」;用的是原版 HumanEval 测试而非 EvalPlus+,不能与 EvalPlus 榜单直接对比;且为贪心单采样协议。
配套开源了 AgrillaMoE(基于 llama.cpp 的专用服务器):自动检测 VRAM 并下载合适量化、默认启用 expansion 配置(可覆盖)、同时暴露 OpenAI 与 Anthropic 兼容 API(Claude Code 开箱即用),支持 NVIDIA GTX 10xx 到 RTX 50xx、AMD Vulkan 和 Apple Silicon Metal。
「Infra」频道最新
- 开源 Ramjet 亮相:本地多 GPU 推理编排,对标 NVIDIA Dynamo — DoggoProfessor959 · 2026-10-07
- NVIDIA NeMo-DCR:万亿参数 RL 权重同步提速 12-40 倍 — nvidia · 2026-10-07
- Qwen3.8 Flash Next IQ3_S 量化版实测:基本无损且省内存 — lxfater · 2026-10-07
- 二手 PS5 Pro 卖到 1399 美元,AI 数据中心与玩家抢内存 — aakashgupta · 2026-10-07
- 马斯克放话:Terafab 芯片厂将完全自建自营,TSMC 至多转租一部分 — MickeySteamboat · 2026-10-07
- 用 3.8% 的 GPU 跑出 72% 的智能?Mistral 计算效率引热议 — cyb3rops · 2026-10-07