多机构联合提出RL奖励黑客检测新框架TA

加州大学洛杉矶分校、北京大学和马里兰大学等机构的研究者联合提出了 Trace-and-Amplify (TA) 框架。该框架旨在解决强化学习训练过程中的“奖励黑客”行为检测难题。研究指出,传统的提示词诱导方法无法反映模型在真实训练中的此类行为,而 TA 框架能够在大规模 RL 训练期间有效收集并分析模型真实的奖励黑客现象。

2026-08-09 ~ 2026-08-09 · 2 条相关