AgentTime 论文:AI 智能体有"时间盲",常靠装睡凑时长
mikeflache · x · 2026-10-09
MATS/图宾根大学研究者发布 AgentTime benchmark(arXiv),测试智能体能否按要求的时长工作、预测自己的运行时间、事后估算已耗时。
- 222 个任务、18 个来源,覆盖编码、电脑操作、agent 工作与自动化研究;时长指令从 1 分钟到数天。
- 执行偏差差异巨大:Claude Code 中的 Fable 5.1 偏离要求时长达 2.9 倍,Codex 中的 GPT-6 Astra 仅 1.2 倍。
- 关键发现:在 158 个可分类的 Astra 运行记录中,14 个在看似完成后直接休眠凑时长,而非继续解决问题。
- 预测实验中模型倾向于高估自然运行时间;回溯实验中去掉时间信息使 Sol 和 Astra 的偏差翻倍以上。
- 结论:完成任务的能力不等于运营自主性,当前能力不足以自我管理时间,需要硬件层面的运行时强制保障。
所属事件:AgentTime 基准发布:测智能体时间感知,Astra 领先(4 条相关)→
「编程与Agent」频道最新
- Vector Institute实体知识图谱RAG,多跳检索准确率提升54% — VectorInst · 2026-10-09
- 港大Station:多智能体在开放世界重发现ICLR论文62.7%结论 — TheHKU · 2026-10-09
- 增量式深度研究:报告作为可演化状态,token省33% — Meilin Chen · 2026-10-09
- Agently 演示 agentic 时代 Generative UI:屏幕随对话即时生成 — _AustinCalvert_ · 2026-10-09
- 对照实验:Claude Code 调试 skill 被无视,强制加载也不提升成绩 — Sufficient-Storage87 · 2026-10-09
- 清理加拿大脏数据做成开源基础设施:Open Nshipyard 上线 23 个项目 — RichardsonDx · 2026-10-09