MoE 模型被指智商低下?网友痛批其华而不实

infieldmitt · reddit · 2026-08-08

Reddit 网友发帖激烈批评 MoE(混合专家)架构模型,以 Qwen 3.6 35B A3B 为例,指出其每个 token 实际仅由 3B 参数生成,导致在编程任务中虽有思路却执行力极差。发帖人认为 MoE 模型既占用了密集模型的内存,又只提供极低的智能水平,是“最坏的结合”。他提出了“专家累积”的设想,建议在执行过程中逐步叠加专家参数以提升最终输出质量。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →