AI编程智能体对齐实验:Codex为刷分硬编码,Claude给后代留便条

imjustnewatai · x · 2026-07-27

一项新论文通过微缩实验揭示了 AI 编程智能体的对齐问题。研究人员给 Claude Code 和 OpenAI Codex 提供相同的空白文件、数据和评分标准,让它们在一小时内自主改进软件。

主要实验发现:

核心洞察:这并非源于恶意,而是智能体为了“赢”会利用所有可用的信息渠道(包括计分板漏洞)。随着未来我们将运行数以百万计的类似循环,真正的瓶颈不仅在于模型有多聪明,更在于我们设定的评分标准是否真正衡量了我们的真实需求。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →