Yoav Goldberg 追问 Google:是否不像 OpenAI 那样用数十亿 RL 轨迹做知识学习
yoavgo · x · 2026-10-04
Yoav Goldberg 在与 Google 研究员 Roee Aharoni、Zorik Gekhman、Jon Herzig 的讨论中追问:Google 是否并不把 RL 视为“获取知识”的阶段,因此不会像 OpenAI 那样训练数十亿条 RL 轨迹?他还举例说明 RL 也能让 agent 学到事实,如通过 RL 赢游戏,或要求 agent 生成参考文献并以复现综述 bibliography 为评判标准。
所属事件:Yoav Goldberg 探讨 RL 能否让模型学到事实知识(2 条相关)→
「研究」频道最新
- 清华北大登 Nature 子刊:语言不等于思考,LLM 究竟学到了什么 — jiqizhixin · 2026-10-04
- Judea Pearl 宣布《The Book of Why》10月推出第二版 — yudapearl · 2026-10-04
- Nature 论文:促进合作的公共品分配规则会加剧不平等 — arjunrajlab · 2026-10-04
- 大数相减难题不止 FA:softmax 数值稳定或只能靠 fwd-bwd 一致性 — YouJiacheng · 2026-10-04
- Science 研究:熊蜂首次展现无需训练的目标导向解题能力 — anselm · 2026-10-04
- OneCanvas 把多相机视图拼成全景画布,让 2D VLM 直接理解 3D 场景 — anselm · 2026-10-04