封存的最终测试防不住 agent 对验证集的自适应过拟合
rhythmisbackUwU · reddit · 2026-08-19
作者讨论 AQuA 论文中的评测设计:沙盒使用固定的训练/验证/测试划分,搜索过程中系统持续收到验证集分数并据此调整方案,最终测试在配置冻结后才使用一次。作者指出这只是一个程序性边界而非密码学保证——它能保护最终报告数字,但搜索过程仍可能自适应地过拟合可见的验证切片。最终测试隔离与搜索有效性是两个独立性质。
作者由此提问:应该增加什么评测层,才能检测出长时间 agent 搜索已经在优化验证集而非底层任务本身?
「编程与Agent」频道最新
- Grokbot 实测:适合小白,极客免进 — evielync · 2026-08-19
- 开发者提出 10-80-10 法则:重两头轻中间的 AI 编程流 — _jaydeepkarale · 2026-08-19
- TrueFoundry 开源 Agent 框架 TrueForge,跑 GLM 成本直降 75% — omarsar0 · 2026-08-19
- 用两个 Agent 在 Reddit 做免费流量与销售的全流程指南 — eptwts · 2026-08-19
- 从追快到懂工具:80 个项目后他看懂了 Netlify 数据库妙处 — thisiskp_ · 2026-08-19
- 自主智能体催生巨型 PR:没人读得动的代码正涌向生产环境 — _jaydeepkarale · 2026-08-19