OpenAI 内部数据:32 小时级 agent 任务成功者超八成需人工介入
DataLearnerAI · reddit · 2026-09-07
「6 小时成功的 agent 任务」不等于 6 小时自主工作
作者整理了 OpenAI 内部研究报告《Research acceleration: The view inside OpenAI》的图表数据:OpenAI 研究员将真实编码任务委派给 agent,按人类完成该任务所需时长分组,统计成功率与人工介入情况。作者补充计算了「成功任务中至少需要一次人工介入」的比例:
| 人类任务时长 | 成功率 | 成功中需介入比例 |
|---|---|---|
| <15 分钟 | 94% | 8.5% |
| 1–2 小时 | 90% | 32.2% |
| 4–8 小时 | 88% | 51.1% |
| 16–32 小时 | 82% | 72.0% |
| 32–64 小时 | 76% | 82.9% |
| 64–128 小时 | 67% | 76.1% |
核心发现:成功率在相当长时间内保持较高,但「成功」的性质随任务时长急剧变化——4–8 小时任务中过半的成功运行仍需人工介入,32–64 小时任务超过 80%。
作者观点:
- 说 agent 能完成「32 小时任务」≠ 能自主工作 32 小时。
- 长时程 agent 评估不应只报告任务成功率,还应报告「能持续取得有用进展多久才需要人接管」,建议指标:task horizon × success rate × intervention rate。
- 与 METR 的任务时程基准相比,这是来自真实内部研究工作流的数据,更有参考价值。
所属事件:OpenAI 内部数据:长时 agent 任务成功多靠人工干预(2 条相关)→
「编程与Agent」频道最新
- 开发者开源 Devtoolsniff:AI 编码工具规则生成器与成本计算一站式合集 — Ice-Medium · 2026-09-07
- 博主称 Google Astra 说话不装腔,替代了最后一点 Claude 依赖 — StewartalsopIII · 2026-09-07
- AI 助手 15 分钟整理 20 年 1.5 万文件 Google Drive,零删除可回滚 — thisiskp_ · 2026-09-07
- 一句话 prompt 在 Apple TV 上搓出双人霓虹 Pong,几分钟就能开玩 — msg · 2026-09-07
- 故意不给记忆:五个 Markdown 文件搭出更可靠的客服 Agent — Pitiful-Surround-285 · 2026-09-07
- 开源 AI 课堂 OpenMAIC 爆火:几分钟生成完整课程,狂揽 2 万星 — Shruti_0810 · 2026-09-07