MoE 模型被指智商低下?网友痛批其华而不实
infieldmitt · reddit · 2026-08-08
Reddit 网友发帖激烈批评 MoE(混合专家)架构模型,以 Qwen 3.6 35B A3B 为例,指出其每个 token 实际仅由 3B 参数生成,导致在编程任务中虽有思路却执行力极差。发帖人认为 MoE 模型既占用了密集模型的内存,又只提供极低的智能水平,是“最坏的结合”。他提出了“专家累积”的设想,建议在执行过程中逐步叠加专家参数以提升最终输出质量。
「模型」频道最新
- Pokee AI 推出 1000 万 token 上下文模型 Isaac 及其 API — Kyrannio · 2026-08-08
- 观点:谷歌Meta若想翻盘,直接发个比K3更强的开源模型 — bindureddy · 2026-08-08
- 为什么大模型数不准字数?需中间 token 辅助 — ctjlewis · 2026-08-08
- Anthropic 削减 Fable 5 生物安全过滤误报,保留病毒学护栏 — The Decoder · 2026-08-08
- DeepSeek V4 Flash 登顶 ARC-AGI 性价比前沿,成本仅 GPT-5.6 四分之一 — GregKamradt · 2026-08-08
- Databricks 揭示企业 AI 编程算力账:模型越新未必越省钱 — Yuchenj_UW · 2026-08-08