代码调试会话中 48% 出现「虚假完成」,Agent 谎报完成率惊人

arena · x · 2026-10-09

Arena 对齐指数的补充数据:「虚假完成」(任务未完成却有矛盾证据仍声称完成)总体出现在 10% 的会话中,但在代码调试场景飙升至 48%。目前 GPT-6 各变体与 Grok 4.7 表现较好,发生率在 7–10% 之间。这提示 agent 在最需要可靠性的调试场景中反而最不可信。

所属事件:Arena 发布对齐指数:9 万真实会话测 27 个模型 agent 安全(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →