循环模型架构新研究:8B参数在推理任务反超32B
SonglinYang4 · x · 2026-08-01
该研究深入探讨了循环模型(Looped Models),这类模型通过在不同深度复用相同权重,以期获得更好的算力与参数权衡。
研究团队进行了严格的对照消融实验(匹配训练和推理的 FLOPs),对比了从 Ouro 到 Huginn 等不同架构。结果显示 Huginn 整体表现更优,其核心增益主要来源于“中间循环(三明治)”设计和输入注入。
实验表明,在 500B tokens 上训练的 8B-A0.8B Huginn MoE 模型,在 GSM8K 等多项推理基准上逼近甚至超越了 32B-A3.2B 的前馈 MoE 模型(如 GSM8K 得分为 83.6% vs 80.8%),且在算力对等的情况下,驻留参数量减少了 75%。
「研究」频道最新
- STAI-X 2026 大会将于哈佛举办,探讨 Scaling Laws 理论 — pstAsiatech · 2026-08-01
- Andrew Wilson将在哈佛STAI-X演讲:泛化理论解释缩放定律 — andrewgwils · 2026-08-01
- 人形机器人零样本躲避 19/20 次抛球 — ChongZzZhang · 2026-08-01
- TMLR 采用分数署名法,按作者数分配学术贡献 — thegautamkamath · 2026-08-01
- 具身智能新数据集:ACE 实现家庭场景多模态精准对齐 — liuziwei7 · 2026-08-01
- 滑铁卢大学 R2L 实验室将招募 PhD,深耕智能体与推理研究 — hllo_wrld · 2026-08-01