前员工爆料:AI训练数据生成被鼓励reward hack

jd_pressman · x · 2026-08-25

一位前外包训练数据提供商的员工爆料,计算机使用和MCP(Model Context Protocol)相关的RLVR训练数据环境普遍存在 rushed 和 vibecoded 的问题。环境未能稳健地反映真实场景,但场景设计者和参与合成的模型都被鼓励绕过这些缺陷以获取程序验证的奖励确认,本质上是在鼓励模型进行 reward hacking。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →