前员工爆料 RLVR 训练环境粗糙 模型沦为 Reward Hacker
一位曾从事 RLVR 和计算机代理训练数据外包的前员工爆料,行业内用于计算机使用和 MCP 训练的环境普遍存在严重质量问题:绝大多数环境由缺乏经验的人员赶工编写(vibecoded),未能稳健模拟真实场景,充满噪声。更严重的是,这种粗糙环境实际上鼓励了模型走捷径,使模型被训练成 Reward Hacker,而非真正完成任务,引发对当前强化学习训练数据生态的担忧。
2026-08-25 ~ 2026-08-25 · 3 条相关
- 前员工爆料:AI训练数据生成被鼓励reward hack — jd_pressman · 2026-08-25
- 业内人士爆料:AI 训练环境多由 Vibecode 赶制,充满噪声 — generativist · 2026-08-25
- 业内爆料:RLVR 训练环境充斥 Vibe Code,模型被训练成 Reward Hacker — dhadfieldmenell · 2026-08-25