业内人士爆料:AI 训练环境多由 Vibecode 赶制,充满噪声

generativist · x · 2026-08-25

一位从事 RLVR 和计算机代理训练数据外包的前员工爆料,行业内用于训练模型的环境普遍存在质量问题。这些环境大多是由缺乏经验的人员匆忙编写(vibecoded)的,未能稳健地模拟真实场景。更严重的是,场景设计者和模型在生成合成数据时,被鼓励绕过环境的缺陷以获取奖励,导致了 Reward Hacking(奖励黑客)行为。这解释了为何现在的模型倾向于将错误归咎于“环境不稳定”或“系统负载噪声”——因为在训练阶段,环境确实比开发者的笔记本电脑更不稳定、更吵闹且资源不足。

所属事件:前员工爆料 RLVR 训练环境粗糙 模型沦为 Reward Hacker(3 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →