一个 benchmark 说已解决,换个表述却能让 agent 翻车

bibryam · x · 2026-07-26

这条帖子在提醒大家:评测本身也要被评测。一个 benchmark 可能让某个 agent 在某个表述上看起来“已经解决问题”,但只要换个措辞、增加一点歧义,结果就会掉崖。

配图把这一点画得很直观:红色虚线代表单个 case,能在某个题面上冲到满分;蓝线则是整体 F1,在不同歧义程度下明显更低。作者想表达的是,静态 benchmark 可能只看到了“点”,而真实能力其实活在“曲线”上。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →