长程任务仍是重灾区:WeaveBench 最优通过率仅 41.2%
rohanpaul_ai · x · 2026-08-30
Rohan Paul 转发讨论长程 agent 的可靠性问题:在 WeaveBench 的 114 个 GUI-CLI 混合任务上,目前官方报告的最好通过率仅 41.2%——更好的模型并没有带来长程可靠性的到来。
核心观点:
- 当前模型能处理局部步骤,但需要显式的可审计状态才能让整个任务保持在轨
- 长程 agent 往往能解出每一步却整体失败,因为历史记录对「什么已完成、什么失败、什么剩余」变得不可靠
- LongHorizon-Harness 把这当作任务状态管理问题,认为长程可靠性既取决于模型,也同样取决于模型外层的 harness
被引用的原推是 Chamath 在斯坦福 AI Club 的激烈表态:「长程任务就是个笑话,它们不管用,我不在乎别人怎么说。别给我看愚蠢的评估,别告诉我你跑了 48 小时的脚本。」他并预测 AI 将经历炒作周期后的幻灭低谷。
所属事件:长时程 Agent 仍是短板:WeaveBench 最高通过率仅四成(2 条相关)→
「漫话AGI」频道最新
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Prompting 只是过渡,未来人机协作将依赖新感官 — vykthur · 2026-09-01
- Gary Marcus 深度拆解 OpenAI 事件中的误导性叙述 — GaryMarcus · 2026-09-01
- Spotify 将标注 AI 艺人,但人类使用 AI 的界限在哪? — VraserX · 2026-09-01
- 意识科学家 Anil Seth:当前「AI 意识」存在的置信度接近零 — anilkseth · 2026-09-01