Epoch AI 审计 15 个 AI 基准:4 个通过,9 个被发现有缺陷
pvncher · x · 2026-09-18
Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,首批覆盖 15 个基准:4 个获 Verified 认证,9 个被发现存在缺陷,2 个信息不足无法评审。作者 @charliermarsh 举例称 DeepSWE v1.1 的 verifier 会丢弃 agent 对部分测试文件的修改,但模型并未被告知这一点,导致大量「无关」的失败案例。
所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个通过验证(9 条相关)→
「模型」频道最新
- Sakana 发布 Fugu Max:动态路由多模型编排,免费开放使用 — tkasasagi · 2026-09-18
- 有人预测:未来所有 LLM 都会原生内置「jev 模式」 — multimodalart · 2026-09-18
- 开发者热议:LLM 厂商为何不在模型「性格」上展开竞争 — dioscuri · 2026-09-18
- 用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度 — Gradio · 2026-09-18
- 拆解 Astra 的 ASCII 艺术机制:坐标作画加字符纹理,非 SVG 转换 — dyot_meet_mat · 2026-09-18
- 研究者公开道歉承认榜单提交违规,承诺按规则重跑模型 — AlbertQJiang · 2026-09-18