Terminal-Bench「凉了」:编码基准再被刷穿遭群嘲
rickasaurus · x · 2026-10-08
@rickasaurus 发帖称 Terminal-Bench 已经「cooked」(被刷穿/失效),并自嘲式补刀「显然这些基准毫无意义」。这反映了模型刷榜速度超过基准更新速度、编码类 benchmark 快速失去区分度的行业讨论。
所属事件:基准测试接连被刷穿 AI评测体系遭质疑(2 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Haiku 5.5:比上代便宜约 75% 的小模型 — almmaasoglu · 2026-10-08
- 幻觉话题正在降温?Pew 研究员观察与 Felix Simon 的讨论 — _FelixSimon_ · 2026-10-08
- Claude Haiku 5.5 发布:与 GPT-6 Luna 同价,但暗藏 token 膨胀 — Simon Willison · 2026-10-08
- 实测 Haiku 5.5 替代 Opus 跑浏览器测试:漏一项但性价比突出 — kevinkern · 2026-10-08
- 用户实测:Grok 查法律文件找出团队和 AI 检查都漏掉的问题 — iruletheworldmo · 2026-10-08
- Alsop:谁能不阉割新模型,谁就将赢得下一轮 — StewartalsopIII · 2026-10-08