破解长程任务智能体状态迷失,新框架让准确率大幅提升

Ziyu Ma · hf · 2026-08-04

现有 LLM 智能体在处理长程任务时,常因上下文不断增长导致状态追踪困难与错误累积。研究者提出 LongHorizon-Harness 框架,将执行过程重构为任务状态管理问题。

该框架的核心是 Manage-Execute-Audit (MEA) 循环:

实验表明,该架构在 WeaveBench、Terminal-Bench 和 OSWorld 等基准中显著提升了 Qwen 和 Claude 等模型的表现,例如将 Qwen3.7-Plus 在 WeaveBench 上的成绩从 51.8% 提升至 80.7%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →