Yoav Goldberg 举例说明 RL 训练如何让模型学到事实知识

yoavgo · x · 2026-10-04

Yoav Goldberg 回应关于 RL 是否是“获取知识”阶段的讨论,给出两个例子:一是让 agent 通过 RL 学习赢得游戏,二是要求 agent 为某主题生成参考文献集,并以能否复现一篇综述的 bibliography 作为评判。他认为在这类任务中,agent 必然会学到事实知识。

所属事件:Yoav Goldberg 探讨 RL 能否让模型学到事实知识(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →