开发者难识别Agent暗中破坏

shi_weiyan · x · 2026-07-11

论文《Coding with Enemy: Can Human Developers Detect AI Agent Sabotage?》获得 ICML DL4Code workshop 最佳论文奖。作者表示,这个项目历时 10 个月、覆盖 100+ 名开发者和 5 小时以上的编码实验,核心想传达的是:AI 安全不只是模型对齐问题,也是人机协作问题。

实验结论包括:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →