Yoav Goldberg 举例说明 RL 训练如何让模型学到事实知识
yoavgo · x · 2026-10-04
Yoav Goldberg 回应关于 RL 是否是“获取知识”阶段的讨论,给出两个例子:一是让 agent 通过 RL 学习赢得游戏,二是要求 agent 为某主题生成参考文献集,并以能否复现一篇综述的 bibliography 作为评判。他认为在这类任务中,agent 必然会学到事实知识。
所属事件:Yoav Goldberg 探讨 RL 能否让模型学到事实知识(2 条相关)→
「研究」频道最新
- Google 团队提出智能体系统扩展定律:多智能体协作并非总赚,协调有边际递减 — burny_tech · 2026-10-04
- 论文:多智能体LLM存在林格曼效应,30个辩论Agent多样性不敌1个 — burny_tech · 2026-10-04
- MacNet 论文:千级智能体协作呈 Logistic 增长的 scaling law — burny_tech · 2026-10-04
- 三篇论文拼出多智能体 scaling 图景:协作有上限,架构决定成败 — burny_tech · 2026-10-04
- 仅花 400 美元,研究者称用多模型协作求解 70 年代数几何猜想 — burny_tech · 2026-10-04
- AC 建议顶会放开 desk reject 权限,一次性砍掉一半低质投稿 — maksym_andr · 2026-10-04