放弃交叉熵?用强化学习从零预训练大模型的新范式
tokenbender · x · 2026-08-01
传统语言模型预训练依赖交叉熵,死板地认为只有单个 token 是唯一正确的延续。文章介绍了 avatarl 这一新范式,主张在预训练阶段引入强化学习(RL)框架。
- 机制:模型(player)不再受限于唯一答案,而是基于预训练的 critic 模型和真实数据提供连续的奖励信号。
- 优势:允许模型学习语言的丰富分布,对那些合理、和谐的备选 token 给予奖励,从而建立更深刻、细致的语言理解。
所属事件:探索式建模开辟预训练第三轴,被指重造avataRL轮子(8 条相关)→
「研究」频道最新
- 机器人化身科学家:LabEvolver 让实验成功率升至 91% — imjustnewatai · 2026-08-01
- 困扰学者两年的数学猜想,AI 数分钟写出严谨证明 — abeirami · 2026-08-01
- 开发者开源 Bug 搜寻基准:实测大模型查 Bug 能力 — PawelHuryn · 2026-08-01
- AI 制药瓶颈在数据而非模型,行业预期将迎转折 — MatthewMcAteer0 · 2026-08-01
- 研究:科学文献上下文难提升 LLM 行为预测 — duncanjwatts · 2026-08-01
- Bittensor子网Minos联合OpenAI发布基因组AI合成数据生成器 — markjeffrey · 2026-08-01