既然有 MoE,为何不直接做小型专才模型?
exaknight21 · reddit · 2026-07-24
楼主在讨论 MoE 的一个直觉问题:既然 MoE 里已经有 3B、4B、9B 这样的“小专家”,为什么不直接做一个完整的“小型专家模型”,而要把多个专家塞进一个大模型里?
他举的例子类似“Qwen3.6-3B Coding Expert”,本质上是在问:为什么模型一定要是全能型,不能只精通一个任务?
「研究」频道最新
- ISO提出固定谱RLVR优化栈,100步追平AdamW — burny_tech · 2026-07-24
- Founder Bench测试LLM能否真实运营生意,GPT-5.6 Sol垫底 — davidtsong · 2026-07-24
- GLM 5.2 在长链路浏览基准上接近翻倍 Kimi K3 — zainhas · 2026-07-24
- Long-Horizon Terminal-Bench 更新长时程终端代码评测榜 — Muennighoff · 2026-07-24
- SIGReg 教程从第一性原理推导 JEPA 防塌缩正则 — ShahabBakht · 2026-07-24
- KAT-Coder-V2.5-Dev 开放权重,35B 总参 3B 激活 — AdinaYakup · 2026-07-24