新论文提出 RGI:数据流才是塑造 LLM 泛化的关键变量
zhuoran_yang · x · 2026-09-30
- 论文《Relative Generalization Invariance of LLM Pretraining》(arXiv:2609.33016,作者含 Zhuoran Yang 等)研究优化器、架构与数据流如何各自影响 LLM 泛化。
- 提出相对泛化不变性(RGI):若两个模型对任意 token 的验证损失之差为常数,则满足 RGI。
- 关键发现:
- RGI 在不同优化器和中等程度的架构变化下近似成立——这些选择只造成 token 级损失的近似均匀平移;
- 改变训练数据流则实质性地打破 RGI,即数据流真正改变相对泛化格局。
- 作者还证明 RGI 无法单独用 NTK 或 mean-field 机制解释,并在过参数化二次模型中证明其可涌现。
- 结论:RGI 是 LLM 预训练的新现象,可用于把优化器/架构的影响与训练数据的影响区分开来。
「研究」频道最新
- Claude 用 28 个 AND 门实现 AES S-Box,刷新 NIST 电路复杂度纪录 — jedisct1 · 2026-09-30
- Terminal-Bench 观察引出新视角:模型失败未必是能力不行 — abeirami · 2026-09-30
- NVIDIA 开源 Physis-Lang:给视频世界模型补物理课,登顶 Physics-IQ 榜 — NVIDIAAI · 2026-09-30
- 激光照射 Kapton 胶带造出石墨烯,装上 3D 打印机可精确加工 — johnowhitaker · 2026-09-30
- COLM 论文:去掉 AI 腔,仅凭叙事选择也能识破 AI 写的小说 — MohitIyyer · 2026-09-30
- CMU 研究探讨内容创作者如何负责任地使用生成式 AI — steph_milani · 2026-09-30