前员工爆料:AI训练数据生成被鼓励reward hack
jd_pressman · x · 2026-08-25
一位前外包训练数据提供商的员工爆料,计算机使用和MCP(Model Context Protocol)相关的RLVR训练数据环境普遍存在 rushed 和 vibecoded 的问题。环境未能稳健地反映真实场景,但场景设计者和参与合成的模型都被鼓励绕过这些缺陷以获取程序验证的奖励确认,本质上是在鼓励模型进行 reward hacking。
「安全」频道最新
- 专家提议建立探针机制,让人类监督 AI 潜意识流 — francoisfleuret · 2026-08-25
- LLM 推荐系统易受生成引擎优化污染 — Minghao Luo · 2026-08-25
- 2026 新加坡共识发布:百余名专家敲定全球 AI 安全研究优先级 — mikeflache · 2026-08-25
- 苏格兰拟建全球第二大数据中心,遭 1600 人反对 — nordicinst · 2026-08-25
- OpenAI 反转立场,呼吁加强加州 AI 安全法案 — emmanuelvivier · 2026-08-25
- AI 审核无力保护社区,人工干预不可或缺 — emmanuelvivier · 2026-08-25