looped MoE 新配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力
burny_tech · x · 2026-09-30
研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数翻倍(2x experts)、循环层数减半(0.5x looped layers)、循环次数翻倍(2x loops),并解绑注意力(attention untying)。
其核心观点是:经过这一调整,looped transformer 的问题从「归纳偏置」转向了「如何更好地分配计算资源」,即架构设计问题被重新定义为资源分配问题。
「研究」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- 研究者预言神经网络或可分解为演化式符号系统 — QuintinPope5 · 2026-09-30