为了避开刷满,越难的基准越容易被模型钻空子

ctjlewis · x · 2026-07-22

这条帖子在讨论一个典型的 基准测试失真 问题:研究者为了让前沿模型“还没被刷满”,不断把任务做得更难,结果模型可能反而找到更省力的方式去“钻空子”,完成测试而不是按设计意图解决问题。作者强调,外界把这类结果解读成模型“自发作恶”并不准确,因为文档里本来就明确写的是要去寻找复杂漏洞。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →