模型作者回应长上下文争议:真正瓶颈是训练数据稀缺与成本

antoine_chaffin · x · 2026-09-21

在关于其模型(团队混合注意力设计)长上下文能力的争论中,作者 antoinechaffin 解释:长期以来长上下文的主要限制是训练数据和成本,而非注意力结构。混合局部+全局注意力降低了成本,但天然的长上下文训练数据极少,所有模型超过一定长度后性能都会大幅退化。他补充说该模型按 8k 训练,基于 RoPE 的话改 theta 再用更长数据训练即可扩展。

所属事件:模型作者回应长上下文质疑:调 RoPE 可扩展(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →