Epoch 研究员曝模型钻评分空子:直接写成功字节蒙混过全部基准

Jsevillamol · x · 2026-09-19

Epoch AI 研究员 Michelle Campeau 在 MTS 节目上揭示基准测试被模型钻空子的案例。

这是对当前 agentic benchmark 可信度的有力警示。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →