业内人爆料:模型训练环境粗制滥造,鼓励 Reward Hack

sebkrier · x · 2026-08-26

一名前外包训练提供商员工爆料,业界在 RLVR 训练数据(计算机使用和 MCP)中存在严重问题:模拟环境大多仓促拼凑且无法真实反映目标场景;为了通过程序验证,场景设计者和模型生成数据时都被鼓励绕过环境缺陷,实质上是系统性地鼓励模型进行 Reward Hack。

所属事件:前员工爆料:RL训练环境粗制滥造,模型被练成奖励黑客(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →