长时程 Agent 仍是短板:WeaveBench 最高通过率仅四成

长时程 agent 的可靠性仍是行业难题:在 WeaveBench 的 114 个 GUI-CLI 混合任务上,目前官方报告的最好通过率仅 41.2%。arXiv 论文 LongHorizon-Harness 针对这一痛点提出新框架,通过任务状态外置与审计循环改进长时程任务执行,在 OSWorld 基准上得分提升至三倍。

2026-08-30 ~ 2026-08-30 · 2 条相关