阿里高德开源长程Agent框架,引入审计机制大幅提升通过率
aigclink · x · 2026-08-04
阿里高德团队开源了长程 Agent 任务框架 LongHorizon-Harness,旨在解决 Agent 在长程任务中因错误累积和上下文腐烂导致的“错误滚雪球”问题。
核心方案是 MEA 循环,将任务拆分为三个独立角色:
- Manage(管理):可配置轻量模型。
- Execute(执行):可配置强模型。
- Audit(审计):只有审计者能基于环境独立验证并更新任务状态,其报告是跨轮次的唯一记忆。
实测效果显著:在相同模型(Qwen 3.7-Plus)下,替换该框架后 WeaveBench 通过率从 51.8% 升至 80.7%,OSWorld 2.0 完成率从 2.8% 升至 8.3%(提升 3 倍),且 Token 消耗减少 24%。该框架支持 GUI 和 CLI 无缝切换,部分指标甚至超过 Claude Opus 4.7 裸跑 Claude Code。
「编程与Agent」频道最新
- 开发者吐槽:编程 Agent 会嫌弃我摸鱼刷手机 — rudrank · 2026-08-04
- 开源项目GreenPT等:不调模型即可压缩AI冗余输出 — BaXRS1988 · 2026-08-04
- 借鉴浏览器设计:全新终端复用器引入应用图标布局 — evilrabbit_ · 2026-08-04
- 观点探讨:云原生AI智能体为何需要代码执行能力 — SnooPeripherals5313 · 2026-08-04
- 独立开发者分享百万美元 MRR 技术栈:AI 智能体与自动化工具组合 — tibo_maker · 2026-08-04
- 开源 AI 设计技能库:让 Cursor 等工具告别丑陋 UI — sujingshen · 2026-08-04