Yoav Goldberg 探讨 RL 能否让模型学到事实知识
AI 学者 Yoav Goldberg 参与关于 RL 是否构成「获取知识」阶段的讨论,举例说明 RL 训练可让 agent 学到事实知识,如通过 RL 学会赢得游戏,或为某主题生成参考文献集。他还在与 Google 研究员 Roee Aharoni 等人的交流中追问,Google 是否不像 OpenAI 那样使用数十亿条 RL 轨迹进行知识学习,引发对两大阵营训练范式差异的关注。
2026-10-04 ~ 2026-10-04 · 2 条相关
- Yoav Goldberg 举例说明 RL 训练如何让模型学到事实知识 — yoavgo · 2026-10-04
- Yoav Goldberg 追问 Google:是否不像 OpenAI 那样用数十亿 RL 轨迹做知识学习 — yoavgo · 2026-10-04