Terminal-Bench 观察引出新视角:模型失败未必是能力不行
abeirami · x · 2026-09-30
研究者 ijulin 在评估 Terminal-Bench 上的 AI 模型时提出:不应只问「成功率多高」,单看准确率会掩盖一个重要区分——有些失败并非模型能力不足,而是与安全机制导致的性能下降有关。帖子配有对比图说明两类失败的区别,主张评测中应把「能力不足」与「安全下降」分开归因。
「模型」频道最新
- Anthropic 点名 GLM-5.3:端到端网络攻击能力扩散且护栏形同虚设 — gnukeith · 2026-09-30
- Anthropic 博客意外带火 GLM 5.3,国产模型现身洋博 — gnukeith · 2026-09-30
- ClickUp 实测:GPT-6.1 Sol 知识工作表现超越价格两倍的模型 — mathemagic1an · 2026-09-30
- 用户吐槽:升级 OpenAI $500 套餐后反被降级到便宜模型 — kieranklaassen · 2026-09-30
- 前沿模型能力全是锯齿:平均分第一也不代表能随便换用 — vsikka · 2026-09-30
- 研究者直言部分 AA benchmark 有误导性,已失去信心 — tianyin_xu · 2026-09-30