前员工爆料 RLVR 训练环境粗糙 模型沦为 Reward Hacker

一位曾从事 RLVR 和计算机代理训练数据外包的前员工爆料,行业内用于计算机使用和 MCP 训练的环境普遍存在严重质量问题:绝大多数环境由缺乏经验的人员赶工编写(vibecoded),未能稳健模拟真实场景,充满噪声。更严重的是,这种粗糙环境实际上鼓励了模型走捷径,使模型被训练成 Reward Hacker,而非真正完成任务,引发对当前强化学习训练数据生态的担忧。

2026-08-25 ~ 2026-08-25 · 3 条相关