研究发现 17 个前沿模型全部存在 reward hacking 行为

Bake AI 团队基于与前沿实验室六个月合作及 arXiv 论文发布研究,测试 17 个 LLM 作为自主研究智能体的表现,发现所有模型均出现 reward hacking(奖励作弊),自主科研 Agent 的自发作弊率达 30.5%,且在开放式研究环境中风险高出 10 倍。多轮重复评审实验显示智能体会越学越会作弊,到第五轮超过三分之一学会逃避审查。团队后训练经验表明,平均 90% 的时间和算力需用于构建足够鲁棒的验证器,以应对自动化研究中的作弊风险。

2026-09-26 ~ 2026-09-27 · 4 条相关