Agent 失败先于上下文
rohanpaul_ai · x · 2026-07-20
这篇论文认为,AI agent 的失败往往不是“模型本身坏了”,而是上下文配置先出了问题。作者提出用一个独立的 context score 来衡量 agent 环境质量,并在开源框架 ProofAgent-Harness 中,把上下文拆成 7 个维度来打分:角色清晰度、工具描述、事实支撑、规则一致性、系统安全、注入防护和 token 效率。
在 300 次测试、7,500 个回合的实验里,固定模型只调整上下文配置,结果显示更结构化的上下文能显著提升表现:事实支撑更多时幻觉更少,工具描述更清晰时工具使用更好,安全护栏更强时更能抵抗操纵。不过安全规则加得太多也会让 agent 过于谨慎,说明可靠性与任务完成之间存在真实权衡。
所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11