开发者答疑:模型按 8k 训练,调 RoPE theta 可扩长上下文
antoine_chaffin · x · 2026-09-21
模型作者 antoinechaffin 回应关于上下文长度的质疑:
- 延长 maxlen(README 默认 512,可调至 2048/4096/8192)不会损害长上下文表现,8k 正是训练时所用长度。
- 架构细节:编码器采用 18 层 128 token 滑窗注意力 + 10 层全注意力。
- 技术上是 RoPE,想更长可以改 theta 并用更长数据继续训练。
所属事件:模型作者回应长上下文质疑:调 RoPE 可扩展(2 条相关)→
「模型」频道最新
- 实测 Codex computer use:Astra 稳定,Luna/Sol 频繁失灵 — FamilyNP · 2026-09-21
- 实测发现 service_tier=fast 仅限 API,ChatGPT 订阅通道不支持 — TrickyPlastic · 2026-09-21
- 中国开源模型 OpenRouter 消费额狂飙:Moonshot 涨 2425% — FinanceYF5 · 2026-09-21
- Yacine 吐槽:编程 LLM 产出全是不必要的复杂垃圾 — yacineMTB · 2026-09-21
- 研究者指出:LLM 写的 related work 很有说服力但不等于全面 — lucacarlone1 · 2026-09-21
- The Information:OpenAI 新模型 Astra 所用秘技引发安全担忧 — keviv9 · 2026-09-21