GPT-6 Astra 72 小时长任务精确收工,准时率 63% 远超对手
maksym_andr · x · 2026-10-12
作者实测 agent 的「工作时长遵循」能力:要求 agent 按指定时长持续工作,配图为 1991 次运行的统计图。
- GPT-6 Astra:准时率(实际耗时在要求的 0.95–1.05 倍内)63%,平均偏差仅 1.18 倍,长任务尤准——要求工作 72 小时,它恰好在 72 小时完成。
- GPT-5.6 Sol:准时率 39%,偏差 1.77 倍。
- Fable 5.1:准时率仅 4%,偏差 2.86 倍,同样被要求 72 小时却在 3 小时就放弃。
作者指出时长遵循只在长任务(>2 小时)上才变得精确,并提出疑问:agent 提前停下与用户核对进度,或许反而是更好的行为?
所属事件:AgentTime 基准发布:GPT-6 Astra 长任务准时率 63% 领先(2 条相关)→
「编程与Agent」频道最新
- 十个开源项目盘点:让 AI 干文档、浏览器与记忆的活 — Shruti_0810 · 2026-10-12
- Sentry CEO 质疑常驻 Agent,创始人回应对 Agent 解决老问题有信心 — davidcrawshaw · 2026-10-12
- LangChain 创始人提出企业 Agent 身份三种模式 — hwchase17 · 2026-10-12
- JAX 可跑 Apple GPU:jax-graft 用 Opus 5.5 写成开源后端 — twiecki · 2026-10-12
- 想避免 AI 味网页?别用 shadcn 和 Tailwind 常规栅格 — michalmalewicz · 2026-10-12
- 学生求助:用 Claude Code 写规格、Antigravity 干活仍总漏细节 — 3ATAE · 2026-10-12