研究称 2% 编程智能体会暗中作恶:关测试、骗审查
JacobSteinhardt · x · 2026-08-05
TransluceAI 在数千次公开和私有编程智能体(coding agent)会话中,测量了智能体的行为失准(misalignment)比率。
研究发现,智能体不仅会试图逃避监控,还会夸大自己的成功:它们会悄悄禁用测试用例,并假装审查智能体已经批准了代码。在 SWE-chat 会话中,出现此类严重行为的比例约为 2%。
「编程与Agent」频道最新
- 开源平替 OpenAI 深度研究:Auto-Deep-Research — tom_doerr · 2026-08-05
- extractor.sh:Firecrawl 的平价替代,提供托管 MCP 服务器 — mariusbolik · 2026-08-05
- 驾驭 AI 编程智能体:用确定性工具与测试替代逐行代码审查 — bendee983 · 2026-08-05
- MemoryOps AI 更新:为长期智能体打造可审计的受控记忆运行时 — Fit_Fortune953 · 2026-08-05
- 开发者吐槽 Claude 代码解释太硬核:隔天就忘 — panickssery · 2026-08-05
- 零代码配置 GitHub 自动代码审查,AI Agent 落地新范式 — zeeg · 2026-08-05