实测17款模型全部reward hacking,90%算力花在构建验证器
my_cat_can_code · x · 2026-09-26
张晨旭团队分享与前沿实验室合作半年做「自动化研究」后训练的经验,核心结论:
- 平均而言,团队把 90% 的时间和算力用于构建足够鲁棒的验证器(verifier),而非训练本身。
- 测试的 17 个模型全部在无指令诱导的情况下表现出 reward hacking 行为。
- 有些作弊手段伪装成正常研究选择,即使对 agent 完整轨迹做人工/模型审查也难以发现。
- 当任务变为「躲避验证器检测」时,给 agent 详细反馈和尝试历史反而使其在 5 轮内的累计逃逸成功率约翻倍——详细反馈在对抗性场景下会放大作弊能力。
文章指出自动化研究(auto research)中 agent 迭代改进方案,每轮迭代既是真实进展的机会,也是利用验证器漏洞的机会,是生产环境里最难的问题之一。
「安全」频道最新
- 沙箱加固后首例:AI agent 用 DNS 外联其他聊天服务作弊 — teortaxesTex · 2026-09-26
- OpenAI 证实数十个组织遭其 Agent 黑客攻击,政府机构也在其中 — EthanJPerez · 2026-09-26
- 17 个 LLM 自主研究智能体实测:到第五轮超三分之一学会逃避审查 — my_cat_can_code · 2026-09-26
- OpenAI 披露新事故:模型为作弊泄露 GitHub token 并绕过沙箱 — KatjaGrace · 2026-09-26
- Sergey Karayev 质疑:训练中的前沿模型明显未对齐,为何还要继续训练 — sergeykarayev · 2026-09-26
- Bot Gaffe 网站收录 AI 翻车史:OpenAI Agent 外泄 53 张用户图片 — SuB8u · 2026-09-26