Ai2 发布 Olmo Hybrid:混合架构省 49% 训练 token 达同精度

allen_ai · x · 2026-10-10

非营利实验室 Ai2 在旧金山 COLM 2026 大会总结其开源研究与 AI for Science 进展。

核心论文《Olmo Hybrid: From Theory to Practice and Back》探讨了将 transformer 注意力与线性循环层结合的混合架构:注意力负责从上下文中检索具体细节,循环层以紧凑状态维护序列信息。实验显示该架构能用少 49% 的训练 token 在 MMLU 上达到 Olmo 3 7B 同等精度。

这一结论正在指导下一版 Olmo 的预训练:采用注意力+循环的混合 MoE 架构。Ai2 强调以非营利身份公开模型、数据、代码和方法是其研究方式的核心。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →