长时程 Agent 仍是短板:WeaveBench 最高通过率仅四成
长时程 agent 的可靠性仍是行业难题:在 WeaveBench 的 114 个 GUI-CLI 混合任务上,目前官方报告的最好通过率仅 41.2%。arXiv 论文 LongHorizon-Harness 针对这一痛点提出新框架,通过任务状态外置与审计循环改进长时程任务执行,在 OSWorld 基准上得分提升至三倍。
2026-08-30 ~ 2026-08-30 · 2 条相关
- 长时程任务新框架:任务状态外置+审计循环,OSWorld 得分翻三倍 — rohanpaul_ai · 2026-08-30
- 长程任务仍是重灾区:WeaveBench 最优通过率仅 41.2% — rohanpaul_ai · 2026-08-30