评测集答案总是「中心样例」,真实答案却往往是反常案例

voooooogel · x · 2026-09-26

开发者在讨论某个评测集时指出一个系统性问题:在这些例子里,现实中真正正确、有趣的答案往往是 quirky / unusual 的边缘情况,而评测集标注的参考答案却是「最典型、最中心」的例子。这意味着按评测集打分可能系统性低估模型处理真实反常场景的能力,或引导模型学会「猜中心答案」。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →