字节新论文:测试 AI Agent 是否真的听话

rohanpaul_ai · x · 2026-08-18

字节跳动提出新评估框架 Harness-IF,质疑现有测试可能高估了 AI Agent 的可控性,因为测试往往符合模型的默认行为。该框架引入“反直觉规则”,即要求 Agent 执行与其默认倾向相悖的指令,并在系统提示、工具描述、项目文件等多个表面进行测试。在 12 个前沿模型和 60 个多轮编程任务中,所有模型在对抗优先规则下的表现均有所下降,揭示了当前 Agent 在指令遵循方面的短板。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →