预训练决定低秩几何,微调无法修复基础错误
yunta_tsai · x · 2026-08-21
核心观点是预训练负责确立正确的低秩几何结构,而强化学习(RL)负责微调形状。如果低秩几何基础打得好,需要的微调就越少。反之,如果观察数据存在巨大缺口,微调无法修复低秩层面的错误,因为优化器根本不知道正确的形状应该是什么。
所属事件:观点:预训练决定低秩几何,RL微调仅能修形状(2 条相关)→
「研究」频道最新
- GoodfireAI 拨款百万美元推动 AI 可解释性研究 — mathildepapillo · 2026-08-22
- UPenn 研究员将分享流图维度扩展与去噪技术 — jmhernandez233 · 2026-08-22
- 数据集翻车:multiPL-E 的 MBPP 子集因正则误操作造出 Rsthon — code_star · 2026-08-22
- Qwen-3.8-27B 在 Strix Halo 上的本地部署与优化指南发布 — PieBru · 2026-08-22
- 动态重打光数据增强:随机化 Dataloader 实践 — StephanSturges · 2026-08-22
- Bilawal Sidhu:射频是下一代世界模型的数据新边疆 — bilawalsidhu · 2026-08-22