Epoch AI 审计 15 个 AI 基准:4 个通过,9 个被发现有缺陷

pvncher · x · 2026-09-18

Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,首批覆盖 15 个基准:4 个获 Verified 认证,9 个被发现存在缺陷,2 个信息不足无法评审。作者 @charliermarsh 举例称 DeepSWE v1.1 的 verifier 会丢弃 agent 对部分测试文件的修改,但模型并未被告知这一点,导致大量「无关」的失败案例。

所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个通过验证(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →