模型作者回应长上下文质疑:调 RoPE 可扩展

针对外界对其模型长上下文能力的质疑,模型作者 antoinechaffin 回应称,该模型按 8k 上下文训练,通过调整 RoPE theta 可进一步扩展上下文长度;README 默认 maxlen 为 512,可调至 2048/4096/8192 且不损害长上下文性能。他还强调,长上下文长期以来真正的瓶颈是训练数据的稀缺与成本,而非团队采用的混合局部+全局注意力结构。

2026-09-21 ~ 2026-09-21 · 2 条相关

事件全程(共 2 集)→