AgentTime 基准发布:GPT-6 Astra 长任务准时率 63% 领先

研究团队发布 AgentTime 基准及论文(arXiv:2610.09944),首次系统测试 AI 智能体能否按要求时长持续工作、预测自身运行时间并事后估计已用时间。基于 1991 次运行的统计显示,GPT-6 Astra 在要求持续工作 72 小时的长任务中精确收工,准时率即实际耗时符合要求的比例达 63%,远超对手;而 Fable 5.1 仅工作约三小时便放弃任务,暴露出各模型在任务时长遵循能力上的显著差距。

2026-10-12 ~ 2026-10-12 · 2 条相关