长时程任务新框架:任务状态外置+审计循环,OSWorld 得分翻三倍
rohanpaul_ai · x · 2026-08-30
arXiv 论文 LongHorizon-Harness(2608.01964)针对 LLM agent 执行长时程任务的核心痛点提出方案:
- 问题:现有 agent harness 把任务执行、任务状态与完成判断都塞进不断膨胀的上下文里,状态难以追踪,错误的自我评估还会传导进后续决策。
- 方法:把长时程执行重构为任务状态管理问题——任务状态显式维护在执行之外,只写入从环境独立验证过的事实。核心是 Manage-Execute-Audit(MEA)循环:manager 维护任务状态并决定下一子任务;executor 用全新上下文执行;只读 auditor 在下一轮前验证环境状态。另有轻量 AgentAdapter 支持模型与 harness 后端热插换。
- 结果:Qwen 3.7-Plus 在 WeaveBench 从 51.8% 提到 80.7%,Terminal-Bench 2.1 从 69.7% 到 77.2%,OSWorld 2.0 从 2.8% 到 8.3%;Claude Opus 4.7 在 OSWorld 2.0 子集上从 20.0% 提到 34.3%,跨模型、跨 harness、跨交互域均稳定增益。
「编程与Agent」频道最新
- 你用 Agent 构建且最高频使用的个人应用是什么? — dbreunig · 2026-08-30
- JIT-Agent:弱模型靠自写脚手架击败强模型 — krishnan · 2026-08-30
- 别给 Grok 机器人起名?反方:把任务都委托出去才是正解 — omarsar0 · 2026-08-30
- 实测 Codex 近乎一次通过:20 年老 PHP 代码库重写为现代 JS — cnakazawa · 2026-08-30
- 前工程总监:用 LLM 写代码的核心是构建系统外的系统 — viksit · 2026-08-30
- AI Agent 落地困局:除了客服,还有哪些真有 ROI 的场景? — AdGrouchy7150 · 2026-08-30