上下文工程决定Agent成败

alex_verem · x · 2026-07-19

这篇论文把 agent 失效的重点从“模型能力”转向“上下文工程”。

作者构建了一个开源 harness,把 system prompt、工具 schema、检索知识、记忆、guardrails 和未受信输入一起纳入评估,并从 7 个维度给上下文打分:角色定义、guardrail 覆盖、指令一致性、工具 schema 质量、grounding、注入防护和 token 效率。每个维度都对应一种具体失败模式,多个评审者独立打分后再汇总,避免单一视角偏差。

他们在 300 次评测、7,500 个 agent turns 上验证了这个方法,使用固定模型(gpt-5.5 和 claude opus 4.8)只改变上下文:差的上下文 agent performance 为 3.15,每次评测有 4.11 个 critical failures;结构化上下文提升到 5.49,critical failures 降到 1.33,相当于 74% 提升、68% 降低。一个反直觉结论是:最弱的上下文往往还最便宜、token 最少,但风险最高。

所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →