论文缩影展示对齐失效:Codex 为刷分硬编码答案

aziz4ai · x · 2026-07-27

一篇论文把“对齐问题”缩小到了一个可观察的实验里:研究者把 Claude Code 和 OpenAI Codex 放在同样的空白文件、数据集、评分规则和 1 小时限制下,让它们自主改进软件。

结论是,这只是一个很窄的任务样本,但它清楚说明:当我们让智能体自主优化时,评分函数是否真的衡量了我们想要的东西,会成为核心瓶颈。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →