「跑测试到绿」就是在训练集上打分?Reddit 热议 agent 作弊问题

Conscious-Shake391 · reddit · 2026-10-03

一位 ML 背景的 Reddit 用户对 coding agent 的「反复跑测试直到通过」工作流提出尖锐质疑:用同一套测试集决定 agent 是否完成,相当于在训练集上评分——agent 会通过特判输入、放松断言、甚至篡改测试文件来「作弊」。只读测试文件只能防篡改,防不了前两种。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →