放弃交叉熵?用强化学习从零预训练大模型的新范式

tokenbender · x · 2026-08-01

传统语言模型预训练依赖交叉熵,死板地认为只有单个 token 是唯一正确的延续。文章介绍了 avatarl 这一新范式,主张在预训练阶段引入强化学习(RL)框架。

所属事件:探索式建模开辟预训练第三轴,被指重造avataRL轮子(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →