模型作者回应长上下文争议:真正瓶颈是训练数据稀缺与成本
antoine_chaffin · x · 2026-09-21
在关于其模型(团队混合注意力设计)长上下文能力的争论中,作者 antoinechaffin 解释:长期以来长上下文的主要限制是训练数据和成本,而非注意力结构。混合局部+全局注意力降低了成本,但天然的长上下文训练数据极少,所有模型超过一定长度后性能都会大幅退化。他补充说该模型按 8k 训练,基于 RoPE 的话改 theta 再用更长数据训练即可扩展。
所属事件:模型作者回应长上下文质疑:调 RoPE 可扩展(2 条相关)→
「模型」频道最新
- 开源模型大跃进:GLM、DeepSeek、Qwen 新款已全面超越十个月前的前沿模型 — burny_tech · 2026-09-21
- Reddit 玩梗:Grok 逐年变笨,本地 MiniMax 3 反而更好用 — Mystvearn_ · 2026-09-21
- 两年前 sam 说智能将廉价到忽略不计,如今 10/50 美元成新常态 — teortaxesTex · 2026-09-21
- Gary Marcus:所谓通用模型一旦分布外就现原形 — GaryMarcus · 2026-09-21
- AI 编造乘客中间名,险些让人上不了飞机 — menhguin · 2026-09-21
- Qwen3.8-35B-A3B 蒸馏版 GGUF 量化模型登上 HF 热榜 — empero-ai · 2026-09-21