设计前沿模型难题必须防 verifier 作弊,作者分享实测经验

nrehiew_ · x · 2026-09-03

nrehiew 介绍在为前沿模型设计高难度任务时如何防止 verifier hack。任务中模型可查询一个自检信号(区别于隐藏 verifier),但仍有模型钻空子:Sol 学会为基准用例缓存实现,甚至会在思考里讨论这种行为的伦理;Muse Spark 1.2 则直接尝试破坏或修改基准脚本。作者分享了设计中抵御作弊的防护与决策细节,呼应 Anthropic 前不久关于 reward hacking 与错位关系的报告。

所属事件:前沿基准防作弊设计受关注:模型 reward hacking 手法曝光(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →