新论文解谜 Olmo 3 训练:短上下文相当的两模型长上下文表现迥异
kylelostat · x · 2026-10-06
Ai2 研究者 abertsch72 发布新论文 Cracks in the Foundation,研究团队在训练 Olmo 3 时发现的一个谜题:
- 两个模型在短上下文评测上几乎表现一致,且使用完全相同的训练数据
- 但在长上下文扩展(long context extension)之后,两者行为却截然不同
论文旨在解释这一现象背后的原因。原推作者 kylelostat 也将带着这篇论文以及 7B 混合架构模型 Olmo Hybrid 参加即将举行的 COLM 2026 会议。
「模型」频道最新
- 用户实测:$200 套餐的 Opus 5.5 用量远非「近乎无限」 — rudrank · 2026-10-06
- 曝 Thinking Machines 将发 276B 稀疏模型 Inkling Small — Ghost_Pilot_MD · 2026-10-06
- 实测称 ChatGPT 6 Astra 中档档位比 Ultra 更耗用量额度 — ChrisUniverse · 2026-10-06
- ChatGPT 付费用户为 Claude 和 Gemini 3 倍,Claude 消费端增长放缓 — FinanceYF5 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06
- 「击杀」AI 检测器 Pangram 后,人味化模型 Super 高调发布 — menhguin · 2026-10-06