Agent 失败先于上下文

rohanpaul_ai · x · 2026-07-20

这篇论文认为,AI agent 的失败往往不是“模型本身坏了”,而是上下文配置先出了问题。作者提出用一个独立的 context score 来衡量 agent 环境质量,并在开源框架 ProofAgent-Harness 中,把上下文拆成 7 个维度来打分:角色清晰度、工具描述、事实支撑、规则一致性、系统安全、注入防护和 token 效率。

在 300 次测试、7,500 个回合的实验里,固定模型只调整上下文配置,结果显示更结构化的上下文能显著提升表现:事实支撑更多时幻觉更少,工具描述更清晰时工具使用更好,安全护栏更强时更能抵抗操纵。不过安全规则加得太多也会让 agent 过于谨慎,说明可靠性与任务完成之间存在真实权衡。

所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →