Yoav Goldberg 追问 Google:是否不像 OpenAI 那样用数十亿 RL 轨迹做知识学习

yoavgo · x · 2026-10-04

Yoav Goldberg 在与 Google 研究员 Roee Aharoni、Zorik Gekhman、Jon Herzig 的讨论中追问:Google 是否并不把 RL 视为“获取知识”的阶段,因此不会像 OpenAI 那样训练数十亿条 RL 轨迹?他还举例说明 RL 也能让 agent 学到事实,如通过 RL 赢游戏,或要求 agent 生成参考文献并以复现综述 bibliography 为评判标准。

所属事件:Yoav Goldberg 探讨 RL 能否让模型学到事实知识(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →