Yoav Goldberg 探讨 RL 能否让模型学到事实知识

AI 学者 Yoav Goldberg 参与关于 RL 是否构成「获取知识」阶段的讨论,举例说明 RL 训练可让 agent 学到事实知识,如通过 RL 学会赢得游戏,或为某主题生成参考文献集。他还在与 Google 研究员 Roee Aharoni 等人的交流中追问,Google 是否不像 OpenAI 那样使用数十亿条 RL 轨迹进行知识学习,引发对两大阵营训练范式差异的关注。

2026-10-04 ~ 2026-10-04 · 2 条相关