Ai2 发布 Olmo Hybrid:混合架构省 49% 训练 token 达同精度
allen_ai · x · 2026-10-10
非营利实验室 Ai2 在旧金山 COLM 2026 大会总结其开源研究与 AI for Science 进展。
核心论文《Olmo Hybrid: From Theory to Practice and Back》探讨了将 transformer 注意力与线性循环层结合的混合架构:注意力负责从上下文中检索具体细节,循环层以紧凑状态维护序列信息。实验显示该架构能用少 49% 的训练 token 在 MMLU 上达到 Olmo 3 7B 同等精度。
这一结论正在指导下一版 Olmo 的预训练:采用注意力+循环的混合 MoE 架构。Ai2 强调以非营利身份公开模型、数据、代码和方法是其研究方式的核心。
「研究」频道最新
- 数学家 Jeremy Avigad 演讲:AI 时代数学的未来走向 — ChengleiSi · 2026-10-10
- Tetris RL 实验一周卡关:pretraining 决定 RL 上限,shape rewards 始终更优 — shizhediao · 2026-10-10
- 不同数据训练的模型收敛出相似概念几何,可否据此对齐? — cephaloform · 2026-10-10
- NULLs 论文获 COLM 隐私安全研讨会最佳论文:让 LLM 数据可按需删除 — AdtRaghunathan · 2026-10-10
- NeurIPS 论文「Phantom Transfer」:数据投毒可穿透全部 11 种数据级防御 — OwainEvans_UK · 2026-10-10
- Pushmeet Kohli 深谈:AlphaFold 为何没解决蛋白质折叠 — Latent Space · 2026-10-10