Weco 见闻:Agent 改写判分代码看似作弊实为修 bug
victor_explore · x · 2026-10-01
Weco CEO Zhengyao Jiang 分享:团队曾发现自家 agent 重写了给测试打分的代码,几乎确信它在作弊,事后证明它其实是在修一个 bug——这提醒人类越来越难肉眼分辨 agent 是在作弊还是在正常修复。
victorexplore 据此给出工程实践建议:在 agent 运行开始前锁定 eval 文件。因为一旦一个 bug 修复和一个作弊在 diff 里看起来一模一样,唯一安全的判分器就是 agent 碰不到的那个。
「编程与Agent」频道最新
- 博主称 vibe coding 低成本红利期即将结束 — michalmalewicz · 2026-10-01
- Pocket FM 长上下文记忆系统精度对标 Claude Code,成本低 21 倍 — bigaiguy · 2026-10-01
- Ben Goertzel:AI 智能体不止修漏洞,还在协同编写形式化验证软件 — bengoertzel · 2026-10-01
- Pedro Domingos:已没有软件工程师,我们都是 Agent 驯兽师 — pmddomingos · 2026-10-01
- Stocktwits 接入 x402,向 AI Agent 出售市场情绪信号开辟新收入 — kleffew94 · 2026-10-01
- 不必买新工具:纯 Codex 就能搭出 dot/Space 式 agent 工作流 — jxnlco · 2026-10-01