MoE-to-Dense 入选 NeurIPS 2026 Oral:不重训从 MoE 蒸出稠密小模型
Kangwook_Lee · x · 2026-09-30
论文《MoE-to-Dense》入选 NeurIPS 2026 oral presentation(悉尼)。研究的动机是:如今几乎所有旗舰模型都是 MoE 架构,但小模型因面向内存受限场景、总参数量敏感,仍偏好稠密架构。
论文提出的问题:能否利用现成的 MoE 直接产出稠密模型,而无需从零训练?这为从大 MoE 模型中高效提取适合端侧/内存受限部署的小型稠密模型提供了一条路径。
「研究」频道最新
- CLM 发布即支持 Pi-agent,一条命令即可上手体验 — RulinShao · 2026-09-30
- 无电 100 位加法:Nature 论文展示脚手架 DNA 计算机 — jiqizhixin · 2026-09-30
- 每日探测 34 个 LLM API 抓静默变更:DeepSeek 推理用量一夜涨 10 倍 — Electrical_Rip892 · 2026-09-30
- 新预印本:估 LLM 嵌入维度别用 PCA,EGA 恢复率达 97.6-100% — GolinoHudson · 2026-09-30
- 不信厂商跑分?他写 28 分钟指南教你自建 eval 并爬坡优化 — ghumare64 · 2026-09-30
- 只许输出 Simple Wikipedia 没见过的二元组,Gemma 4B 被逼出满屏错字 — cephaloform · 2026-09-30