论文横评 26 个 7B 模型:省算力的架构反而不擅长长上下文
eyishazyer · x · 2026-08-17
该论文在固定数据、tokenizer 和上下文扩展方案的前提下,对比了 26 个规模均为 7B 的可比模型,唯一变量是 4 种架构选择。核心发现:一些让 transformer 更便宜、更稳定的架构选择,反而使其更难扩展到长上下文——模型在短上下文预训练中表现完全正常,仍可能不适合后续做长上下文。发帖人据此评论:短上下文 benchmark 显然没讲出全貌,长上下文压力测试应当更早进行。
所属事件:研究:细微架构选择严重拖累模型长上下文能力(2 条相关)→
「模型」频道最新
- 谷歌论文:事实明明存在,模型却依然产生幻觉 — dejanseo · 2026-08-17
- HF 下载量仍是选模型最实用指标,作者点赞 Muse 与 Qwen — ariG23498 · 2026-08-17
- Qwen3.8-27B Cold Fusion 模型发布 HF 趋势榜 — DavidAU · 2026-08-17
- Frameo 登顶 Physion Arc 1.0 排行榜 — NirantK · 2026-08-17
- Anthropic 公布 27 分钟 Claude 提示词工作坊 — aftahi_ai · 2026-08-17
- DeepSeek大幅涨价,Cola Token Plan调整模型价格以保用户权益 — oran_ge · 2026-08-17