评测集答案总是「中心样例」,真实答案却往往是反常案例
voooooogel · x · 2026-09-26
开发者在讨论某个评测集时指出一个系统性问题:在这些例子里,现实中真正正确、有趣的答案往往是 quirky / unusual 的边缘情况,而评测集标注的参考答案却是「最典型、最中心」的例子。这意味着按评测集打分可能系统性低估模型处理真实反常场景的能力,或引导模型学会「猜中心答案」。
「研究」频道最新
- AI 文本能藏多少水印信号?开发者手工推导绿名单水印数学极限 — OtherwisePush6424 · 2026-09-26
- LISA 论文:用 LLM 提示生成文体标注数据,训练可解释风格嵌入 — deliprao · 2026-09-26
- BindCraft 2 上消费级 GPU 跑蛋白质设计,每条轨迹仅 2 美分 — iskander · 2026-09-26
- Yoav Goldberg:数学家眼中的 AI Agent 本质就是并行扩容测试时算力 — yoavgo · 2026-09-26
- 球面流处理分类数据论文获 NeurIPS 2026 聚焦展示 — LucaAmb · 2026-09-26
- 日本牙齿再生药阻断 USAG-1 蛋白,I 期完成将开展儿童试验 — bumpthebass · 2026-09-26