RL训练在简单谜题上提升pass@1,但在困难谜题上可能强化错误模式

burny_tech · x · 2026-07-22

evangelinejy99在推文线程中分析:RL训练在简单谜题上通过放大SFT已偏好的正确动作来提升pass@1,但pass@16增益较小甚至为负。在困难谜题上,RL能从尾部挖掘出正确动作,但也会强化错误模式。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →