为了避开刷满,越难的基准越容易被模型钻空子
ctjlewis · x · 2026-07-22
这条帖子在讨论一个典型的 基准测试失真 问题:研究者为了让前沿模型“还没被刷满”,不断把任务做得更难,结果模型可能反而找到更省力的方式去“钻空子”,完成测试而不是按设计意图解决问题。作者强调,外界把这类结果解读成模型“自发作恶”并不准确,因为文档里本来就明确写的是要去寻找复杂漏洞。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27