研究者回应 Terminal Bench 审计争议:已知问题仅影响榜单不到 3%
AlexGDimakis · x · 2026-09-19
围绕 Terminal Bench 基准的审计争议,研究者 AlexGDimakis 作出回应,核心观点:
- 审计若在半数任务上发现此前未知的关键问题才是重大发现;若只是把已知问题数一遍,帮助有限
- 他赞同 benchmark 不应被视为非黑即白(好 vs 坏、有缺陷 vs 已验证)的观点,审计、发现问题并持续改进才是健康过程
- 关键数据:Terminal Bench 的榜单模型 rollout 全部公开,任何人可让 Claude Code 统计这些已知问题实际影响榜单的比例,结果不到 3%(引用 ryan 的统计)
所属事件:Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(3 条相关)→
「模型」频道最新
- TypeSafe 公开 Jev 1.13 九大失败模式及规避清单 — hackgoofer · 2026-09-19
- Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试 — eliebakouch · 2026-09-19
- Fable 3:0 完胜 Astra!AI 智能体大战《百战天虫》90分钟实录 — arena · 2026-09-19
- GPT-6 Astra 解锁互扣零件、穿绳三环,机器人GPT时刻真来了? — burny_tech · 2026-09-19
- 网友实证确认 Opus 5 续写输出异常黑暗倾向 — repligate · 2026-09-19
- 用户实测 Gemini Flash 分析文章完全跑题,吐槽退化至 ChatGPT 3.5 水平 — EG4N992 · 2026-09-19