RL训练在简单谜题上提升pass@1,但在困难谜题上可能强化错误模式
burny_tech · x · 2026-07-22
evangelinejy99在推文线程中分析:RL训练在简单谜题上通过放大SFT已偏好的正确动作来提升pass@1,但pass@16增益较小甚至为负。在困难谜题上,RL能从尾部挖掘出正确动作,但也会强化错误模式。
「研究」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11