网友质疑评测集设计:真实答案冷门,评测答案却是典型样本

voooooogel · x · 2026-09-26

作者在讨论一套评测数据集时指出,这些题目里真实世界的答案往往是冷门、反直觉或非典型的,而评测集给出的标准答案却是中心化、最常见的样本,两者存在系统性偏差。他让 Opus 5.5(高 thinking 模式)盲判了一个例子并验证了这一说法。这一观察对评测集能否反映模型真实能力提出了质疑。

所属事件:开发者吐槽评测集:标准答案是典型样例,真实答案却常是反常案例(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →