新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异

kylelostat · x · 2026-10-06

Ai2 研究者 abertsch72 发布新论文 Cracks in the Foundation,研究团队在训练 Olmo 3 时发现的一个谜题:

论文旨在解释这一现象背后的原因。原推作者 kylelostat 也将带着这篇论文以及 7B 混合架构模型 Olmo Hybrid 参加即将举行的 COLM 2026 会议。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →