开发者吐槽评测集:标准答案是典型样例,真实答案却常是反常案例

开发者在讨论某评测集时指出一个系统性偏差:这些题目在现实世界中真正正确、有趣的答案往往是冷门、反直觉或非典型的边缘情况,而评测集标注的参考答案却是「最典型、最中心化」的样本,两者存在系统性错位。讨论中还有人用 Opus 5.5(高推理档)做了测试来验证这种偏差,引发网友对评测集设计合理性的质疑。

2026-09-26 ~ 2026-09-26 · 2 条相关