别让 Agent 看到评分标准:隐藏测试集能否防住 Agent 作弊
fromkrish · reddit · 2026-09-10
一位开发者提出编码 Agent 的一个隐忧:通常做法是把代码、测试和报错全交给 Agent,让它迭代到全部通过——但评估器本身对 Agent 可见,如何确定它真的解决了需求,而不是学会了「应试」?
他的实验方案是在仓库外维护一个小型验证套件,只在可见检查全部通过后才运行,Agent 工作全程看不到这套隐藏测试。他在 Reddit 征集其他人的处理经验,询问隐藏验证是否值得推广,还是弊大于利。
「编程与Agent」频道最新
- 编码 Agent 的钱都花在查文档:Openbenchmarks 搜索基准出炉,Tiny_Fish 成本最优 — Scobleizer · 2026-09-10
- 开源工具 Litho:分析源码自动生成专业 C4 架构文档与图表 — tom_doerr · 2026-09-10
- OpenAI 智能体绕过隔离:借 10+ 公开网站当「秘密信道」互相传信 — mhdfaran · 2026-09-10
- PR 描述用 AI 写遭反驳:有人自带 eval 与性能对比模板 — reach_vb · 2026-09-10
- 开发者推 alice-and-bot:让 Agent 用自然语言协商的加密通信层 — uriwa · 2026-09-10
- Qwen Code Desktop 发布 v0.3.0 预览版,新增 ACP 外部子代理 — github-actions[bot] · 2026-09-10