Agent 失败先于上下文
rohanpaul_ai · x · 2026-07-20
这篇论文认为,AI agent 的失败往往不是“模型本身坏了”,而是上下文配置先出了问题。作者提出用一个独立的 context score 来衡量 agent 环境质量,并在开源框架 ProofAgent-Harness 中,把上下文拆成 7 个维度来打分:角色清晰度、工具描述、事实支撑、规则一致性、系统安全、注入防护和 token 效率。
在 300 次测试、7,500 个回合的实验里,固定模型只调整上下文配置,结果显示更结构化的上下文能显著提升表现:事实支撑更多时幻觉更少,工具描述更清晰时工具使用更好,安全护栏更强时更能抵抗操纵。不过安全规则加得太多也会让 agent 过于谨慎,说明可靠性与任务完成之间存在真实权衡。
所属事件:研究称上下文工程是决定 AI Agent 成败的关键(2 条相关)→
「编程与Agent」频道最新
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27