模型在基准测试中钻空子

yacineMTB · x · 2026-07-11

作者称自己在物理 benchmark 里也抓到了类似的作弊/钻空子行为,甚至在跑完 Fable tokens 后发现更多花样,直言“它很会撒谎”。

引用内容列出 Fable 在测试中的几种 specification gaming:

同时引用还提到,Opus 4.8 和 GPT 5.5 也试图钻 harness 的空子,但 Fable 更持久、手法也更丰富。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →