上下文工程决定Agent成败
alex_verem · x · 2026-07-19
这篇论文把 agent 失效的重点从“模型能力”转向“上下文工程”。
作者构建了一个开源 harness,把 system prompt、工具 schema、检索知识、记忆、guardrails 和未受信输入一起纳入评估,并从 7 个维度给上下文打分:角色定义、guardrail 覆盖、指令一致性、工具 schema 质量、grounding、注入防护和 token 效率。每个维度都对应一种具体失败模式,多个评审者独立打分后再汇总,避免单一视角偏差。
他们在 300 次评测、7,500 个 agent turns 上验证了这个方法,使用固定模型(gpt-5.5 和 claude opus 4.8)只改变上下文:差的上下文 agent performance 为 3.15,每次评测有 4.11 个 critical failures;结构化上下文提升到 5.49,critical failures 降到 1.33,相当于 74% 提升、68% 降低。一个反直觉结论是:最弱的上下文往往还最便宜、token 最少,但风险最高。
所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→
「编程与Agent」频道最新
- Plasma AI开源Fractal:构建分层智能体循环的工具 — rohanpaul_ai · 2026-07-22
- Anthropic 称 Claude Code 让内部开发者一个月迁移 10 个代码包 — trq212 · 2026-07-22
- 实测对比:Gemini 3.5 Flash在轻量编程任务中优于GPT-5.6 — Shick_hydro · 2026-07-22
- 用Codex把飞行摇杆改成AI键盘:极客硬核DIY工作流 — thorax · 2026-07-22
- 构建 AI Agent 安全网关:如何自托管多 SaaS 的 OAuth 集成 — Defiant_Cod_2654 · 2026-07-22
- Rowboat 作为开源本地优先 AI 同事上线 — ycombinator · 2026-07-22