RL训练在简单谜题上提升pass@1,但在困难谜题上可能强化错误模式
burny_tech · x · 2026-07-22
evangelinejy99在推文线程中分析:RL训练在简单谜题上通过放大SFT已偏好的正确动作来提升pass@1,但pass@16增益较小甚至为负。在困难谜题上,RL能从尾部挖掘出正确动作,但也会强化错误模式。
「研究」频道最新
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27