长任务成功率翻倍:阿里MEA循环如何根治上下文腐烂
大模型之路 · wechat · 2026-08-26
长程智能体常因“上下文腐烂”和“目标漂移”导致失败,错误在长对话中累积。阿里开源的 LongHorizon-Harness 提出了“管理-执行-审计”(MEA)循环架构:
- 核心机制:将状态管理从执行上下文中剥离,管理器维护持久任务账本,执行器在全新上下文处理子任务,审计器仅依据环境事实(如文件状态)独立验证结果。
- 实验效果:同一模型采用 MEA 后,在 WeaveBench 上成功率从 51.8% 升至 80.7%,Terminal-Bench 从 69.7% 升至 77.2%。
- 工程启示:长程任务可靠性更多取决于系统设计而非单纯模型能力。代价是 Token 消耗增加(审计开销约 19%–38%),但换取了更高的稳定性。
「编程与Agent」频道最新
- Row-Bot 更新:推出可视化技能发现与 UI 交互系统 — Acceptable-Object390 · 2026-08-26
- 引入任务分级机制,大幅降低 AI 编程 Agent 的 Token 消耗 — jbarbier · 2026-08-26
- 用 AI Agent 构建确定性自动化工作流的新实践 — Lecontodereddit · 2026-08-26
- 实测显示 82.8% 的 AI Agent 无法被其他 Agent 调用 — Sufficient-Pie6680 · 2026-08-26
- MCPay:给远程MCP服务器加按次计费网关,治住失控Agent — TooDu0 · 2026-08-26
- SpaceXAI 工程师演示 GrokBot:用 Agent 团队自动修 Bug — dean_rie · 2026-08-26