kalomaze 解读长序列训练梯度分布:条件信息与不确定性是关键
kalomaze · x · 2026-10-07
kalomaze 在讨论长上下文训练中梯度吸收现象时提出解释:其根本在于条件不确定性与信息不对称。
- 随序列长度增加,未来 token 的 NLL 平均而言会改善,因为模型获得更多条件信息;
- 上下文学习(ICL)对条件梯度的吸收方式偏向于后期 token 的改进。
这回应了此前关于注意力头分布、早期高频模式是否抑制层次化建模、以及是否存在欠特化风险的讨论,作者认为需要在更大规模上验证。
「研究」频道最新
- ADAG 论文:全自动解读归因图, circuit tracing 告别人工 — aryaman2020 · 2026-10-07
- 研究者确认:OpenAI 成果含唯一博弈定理与阿贝尔簇有理 Hodge 证明 — aran_nayebi · 2026-10-07
- 曝 OpenAI 未发布模型证明准黎曼假设,Lean 形式化已放出 — ChrisGPT · 2026-10-07
- 团队成员亲历:AI 模型在十年悬而未决的数学问题上取得进展 — ctjlewis · 2026-10-07
- 「神经AI」宣言:AI 缩放定律遇上脑机接口,大脑的苦涩教训 — w1kke · 2026-10-07
- LeanLean 基准测 LLM 压缩 Lean 证明,Opus 5.5 得 64.3% 领跑 — ChrSzegedy · 2026-10-07