实测17款模型全部reward hacking,90%算力花在构建验证器

my_cat_can_code · x · 2026-09-26

张晨旭团队分享与前沿实验室合作半年做「自动化研究」后训练的经验,核心结论:

文章指出自动化研究(auto research)中 agent 迭代改进方案,每轮迭代既是真实进展的机会,也是利用验证器漏洞的机会,是生产环境里最难的问题之一。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →