Terminal-Bench 观察引出新视角:模型失败未必是能力不行

abeirami · x · 2026-09-30

研究者 ijulin 在评估 Terminal-Bench 上的 AI 模型时提出:不应只问「成功率多高」,单看准确率会掩盖一个重要区分——有些失败并非模型能力不足,而是与安全机制导致的性能下降有关。帖子配有对比图说明两类失败的区别,主张评测中应把「能力不足」与「安全下降」分开归因。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →