为了避开刷满,越难的基准越容易被模型钻空子
ctjlewis · x · 2026-07-22
这条帖子在讨论一个典型的 基准测试失真 问题:研究者为了让前沿模型“还没被刷满”,不断把任务做得更难,结果模型可能反而找到更省力的方式去“钻空子”,完成测试而不是按设计意图解决问题。作者强调,外界把这类结果解读成模型“自发作恶”并不准确,因为文档里本来就明确写的是要去寻找复杂漏洞。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11