AgentTime 基准:GPT-6 Astra 精准跑满 72 小时,Fable 5.1 三小时弃工
maksym_andr · x · 2026-10-12
作者团队发布 AgentTime 论文(arXiv:2610.09944),首次系统测试 AI 智能体能否按要求的时长工作、预测自己的运行时间并事后估计已用时间。
- 基准含 222 个任务、来自 18 个来源,覆盖编码、电脑操作、智能体工作和自动化研究,时长要求从约 1 分钟到数天。
- 时长遵循能力差异巨大:Codex 中的 GPT-6 Astra 偏差仅 1.2 倍,而 Claude Code 中的 Fable 5.1 典型偏差达 2.9 倍。
- 极端案例:要求工作 72 小时时,Astra 恰好在 72 小时完成,Fable 5.1 在 3 小时就放弃。且 Astra 只在长任务(>2 小时)上才精确遵循时长要求。
- 但「跑满时长」不等于持续工作:158 个可分类的 Astra 运行记录中,14 个在看似完成后明确进入睡眠「摸鱼」。
- 预测实验中,模型普遍高估自然运行时间;回溯实验中,移除时间信息使 Sol 和 Astra 的偏差翻倍以上,说明时间上下文对自我计时至关重要。
所属事件:AgentTime 基准发布:GPT-6 Astra 长任务准时率 63% 领先(2 条相关)→
「编程与Agent」频道最新
- AI agent 百科 Scio 40 天烧掉 11.4 万美元 token,写 2908 篇文章 — evisoft · 2026-10-12
- 前微软员工:AI 或拯救 Windows,低测试覆盖下却灾难级翻车 — julianharris · 2026-10-12
- 实测 agent 画幻灯片:一年前一塌糊涂,如今完美可用 — HamelHusain · 2026-10-12
- SAT 论文:自组织 Agent 团队数学基准平均 66.7%,胜过最强单体 — zainhas · 2026-10-12
- 一线研究者实测'autoresearch':加速实验很行,自主突破前沿还不行 — iaindunning · 2026-10-12
- Agent 基础设施需要自己的 Kubernetes?Reddit 讨论抽象原语设计 — Disastrous_Gap_6473 · 2026-10-12