预训练定低秩几何,RL微调调形状
yunta_tsai · x · 2026-08-21
yuntatsai 提出观点:预训练负责确定正确的低秩几何结构,而强化学习(RL)则微调该结构的形状。底层的低秩几何越完美,所需的微调就越少。若观察数据存在巨大空洞,优化器无法得知正确形状,RL 微调无法修复预训练阶段造成的低秩几何错误。
所属事件:观点:预训练决定低秩几何,RL微调仅能修形状(2 条相关)→
「研究」频道最新
- EMNLP 2026 录用:定位 ASR 幻觉的新研究 — auto_grad_ · 2026-08-21
- NBER 新论文:380 万亿 token 数据算出 AI 溢价每周 64 个基点 — PtrPomorski · 2026-08-21
- MazeBench 评测发布:长时序 Agent 挑战,无 Python 仅 1% — JFPuget · 2026-08-21
- 学者质疑 ACL 会议推翻评审决定,批评配额制损害同行评审 — hllo_wrld · 2026-08-21
- 网友设想:用视频生成模型做高层策略,复刻 Generalist 双系统架构 — 12exyz · 2026-08-21
- Yoav Goldberg 回应:平庸工作照样过同行评审,别拿资格说事 — yoavgo · 2026-08-21