破解长程任务智能体状态迷失,新框架让准确率大幅提升
Ziyu Ma · hf · 2026-08-04
现有 LLM 智能体在处理长程任务时,常因上下文不断增长导致状态追踪困难与错误累积。研究者提出 LongHorizon-Harness 框架,将执行过程重构为任务状态管理问题。
该框架的核心是 Manage-Execute-Audit (MEA) 循环:
- Manager:显式维护任务状态并决定下一子任务。
- Executor:在全新上下文中执行具体子任务。
- Auditor:以只读模式验证环境状态后再进入下一轮。
实验表明,该架构在 WeaveBench、Terminal-Bench 和 OSWorld 等基准中显著提升了 Qwen 和 Claude 等模型的表现,例如将 Qwen3.7-Plus 在 WeaveBench 上的成绩从 51.8% 提升至 80.7%。
「编程与Agent」频道最新
- 针对 AI 生成网站的安全漏洞,开发者推出免费扫描工具 Radar — indishere · 2026-08-04
- 别让AI编码助手重复造轮子:RL环境应预装标准库 — cephaloform · 2026-08-04
- 从GAN到智能体集群:AI老兵12年后再遇“对抗性崩溃” — bingxu_ · 2026-08-04
- 开发社媒发布Agent:API审核才是最大拦路虎 — arslan2012 · 2026-08-04
- Qwen 3.8 编码实测:性能逼近 K3 且价格仅一半 — bindureddy · 2026-08-04
- 告别 Docker:db-here 实现 AI 智能体零风险隔离数据库 — andersonbcdefg · 2026-08-04