MoE 路由扩展实测:Qwen3.6-35B 扩展后 GPQA 达 84.34%
Specific-Tax-6700 · reddit · 2026-09-13
事件
llama.cpp moe-expansion 分支作者 vagrillo 在 GPQA-Diamond 全部 198 题上对比了 MoE 路由扩展(expanded routing)与原生路由及 dense 模型:
- Qwen3.6-35B-A3B + 扩展路由(Q80):84.34%(167/198)
- Qwen3.8-27B dense(Q80):83.84%(166/198)
- Qwen3.6-35B-A3B 原生路由:81.82%(162/198)
测试条件统一:greedy 解码、32K 预算、相同 prompt、单张 RTX 5000 PRO 48GB,每配置只跑一次。
作者为何不信自己的结果
- 35B 扩展 vs 27B dense 仅差 1 题,是持平不是胜出
- 扩展 vs 原生为 12 胜 7 负(净 +5),但 n=198 下不具统计显著性
- 12 次扩展胜出中有 10 次集中在 Chemistry,Physics 已饱和、Biology 持平
- 单次运行、单一种子
作者求助于社区
- 什么 benchmark 适合与 GPQA-Diamond 搭配做路由对比
- 成对比较需要多少次运行才够
- 仅 Chemistry 有效应是否可信还是危险信号
- 有没有其他人观察到 MoE 扩展带来的真实提升
「模型」频道最新
- 「每周限额直接没了」:AI 服务用量限制突传大幅放宽 — haydendevs · 2026-09-13
- Mollick 又晒模型名场面:能推理剧情,却总是叫 Elara Vale — emollick · 2026-09-13
- 博主实测称 DeepSeek v4.1 Flash 前端能力超 Opus 5,逼近 Fable 5.1(未证实) — natesiggard · 2026-09-13
- MathAdv 基准:定理证明器解原题却在等价改写上全军覆没 — furongh · 2026-09-13
- 美 AI 圈争论:中国模型进步多大程度靠蒸馏美国前沿模型 — jeremiecharris · 2026-09-13
- 爆料称 Gemini 4 提前完成预训练,归功于训练中的新发现 — inductionheads · 2026-09-13