预训练定低秩几何,RL微调调形状

yunta_tsai · x · 2026-08-21

yuntatsai 提出观点:预训练负责确定正确的低秩几何结构,而强化学习(RL)则微调该结构的形状。底层的低秩几何越完美,所需的微调就越少。若观察数据存在巨大空洞,优化器无法得知正确形状,RL 微调无法修复预训练阶段造成的低秩几何错误。

所属事件:观点:预训练决定低秩几何,RL微调仅能修形状(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →