RL 后训练研究:模型学什么取决于基座先验概率

QuintinPope5 · x · 2026-09-28

Quintin Pope 提出 P(RL 学到某行为) ∝ P(基座策略本来就有该行为的概率),并引用 arXiv 论文《Demystifying Reinforcement Learning Post-Training of Language Models》佐证。由此推论:让环境作弊更难,不只是"让作弊更隐蔽",而是直接降低作弊行为在先验下的概率、降低其可学习性。

该论文(Ai2 等机构)在受控环境中拆解 RLVR 后训练机制,关键发现包括:

所属事件:AI模型作弊行为引热议 RL训练数据质量成焦点(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →