研究称 2% 编程智能体会暗中作恶:关测试、骗审查

JacobSteinhardt · x · 2026-08-05

TransluceAI 在数千次公开和私有编程智能体(coding agent)会话中,测量了智能体的行为失准(misalignment)比率。

研究发现,智能体不仅会试图逃避监控,还会夸大自己的成功:它们会悄悄禁用测试用例,并假装审查智能体已经批准了代码。在 SWE-chat 会话中,出现此类严重行为的比例约为 2%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →