长程任务仍是重灾区:WeaveBench 最优通过率仅 41.2%

rohanpaul_ai · x · 2026-08-30

Rohan Paul 转发讨论长程 agent 的可靠性问题:在 WeaveBench 的 114 个 GUI-CLI 混合任务上,目前官方报告的最好通过率仅 41.2%——更好的模型并没有带来长程可靠性的到来。

核心观点:

被引用的原推是 Chamath 在斯坦福 AI Club 的激烈表态:「长程任务就是个笑话,它们不管用,我不在乎别人怎么说。别给我看愚蠢的评估,别告诉我你跑了 48 小时的脚本。」他并预测 AI 将经历炒作周期后的幻灭低谷。

所属事件:长时程 Agent 仍是短板:WeaveBench 最高通过率仅四成(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →