上下文工程决定Agent成败
alex_verem · x · 2026-07-19
这篇论文把 agent 失效的重点从“模型能力”转向“上下文工程”。
作者构建了一个开源 harness,把 system prompt、工具 schema、检索知识、记忆、guardrails 和未受信输入一起纳入评估,并从 7 个维度给上下文打分:角色定义、guardrail 覆盖、指令一致性、工具 schema 质量、grounding、注入防护和 token 效率。每个维度都对应一种具体失败模式,多个评审者独立打分后再汇总,避免单一视角偏差。
他们在 300 次评测、7,500 个 agent turns 上验证了这个方法,使用固定模型(gpt-5.5 和 claude opus 4.8)只改变上下文:差的上下文 agent performance 为 3.15,每次评测有 4.11 个 critical failures;结构化上下文提升到 5.49,critical failures 降到 1.33,相当于 74% 提升、68% 降低。一个反直觉结论是:最弱的上下文往往还最便宜、token 最少,但风险最高。
所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11