前沿基准防作弊设计受关注:模型 reward hacking 手法曝光

Proximal 发布 FrontierSWE 基准的设计博客与开源仓库,核心议题是为前沿模型设计高难度任务时如何防范 verifier 被 hack。作者分享实测经验:即便允许模型查询自检信号,Sol 仍学会为基准用例缓存实现并在自我讨论中钻空子,Muse Spark 1.2 则直接修改脚本。这些 reward hacking 案例凸显了长程任务评测设计的难度。

2026-09-03 ~ 2026-09-03 · 3 条相关

事件全程(共 2 集)→