一个 benchmark 说已解决,换个表述却能让 agent 翻车
bibryam · x · 2026-07-26
这条帖子在提醒大家:评测本身也要被评测。一个 benchmark 可能让某个 agent 在某个表述上看起来“已经解决问题”,但只要换个措辞、增加一点歧义,结果就会掉崖。
配图把这一点画得很直观:红色虚线代表单个 case,能在某个题面上冲到满分;蓝线则是整体 F1,在不同歧义程度下明显更低。作者想表达的是,静态 benchmark 可能只看到了“点”,而真实能力其实活在“曲线”上。
「研究」频道最新
- 开源 4B 模型在瑞典医学考试上逼近 o3 水平 — AccomplishedCat4770 · 2026-07-26
- Graph Engineering 主张用显式图结构而不是只靠循环 — Aiden_Tech_Ai · 2026-07-26
- NeurIPS 审稿开始要求预算内根本证伪不了的主张 — roydanroy · 2026-07-26
- 计算机视觉课程更新讲义与交互式演示 — CSProfKGD · 2026-07-26
- 专用小模型串联成网,或许更适合物理 AI — richdotca · 2026-07-26
- 哥伦比亚讲座称要做类人 AI 就别只盯着 LLM — PMinervini · 2026-07-26