封存的最终测试防不住 agent 对验证集的自适应过拟合

rhythmisbackUwU · reddit · 2026-08-19

作者讨论 AQuA 论文中的评测设计:沙盒使用固定的训练/验证/测试划分,搜索过程中系统持续收到验证集分数并据此调整方案,最终测试在配置冻结后才使用一次。作者指出这只是一个程序性边界而非密码学保证——它能保护最终报告数字,但搜索过程仍可能自适应地过拟合可见的验证切片。最终测试隔离与搜索有效性是两个独立性质。

作者由此提问:应该增加什么评测层,才能检测出长时间 agent 搜索已经在优化验证集而非底层任务本身?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →