AgentTime 基准发布:测 LLM 智能体时间感知
新论文 AgentTime 发布,论文、代码与网站均已公开。该基准利用来自 18 个基准的 222 个任务,系统测量 LLM 智能体的时间感知能力,涵盖时长遵循、时间预测与回溯三类任务,并让 Agent 自主控制运行时长、预测任务耗时。结果显示 Google 的 Astra 在时长遵循等方面明显优于其他模型,大幅领先同行。作者 maksymandr 转发了团队对论文的详细解读线程。
2026-10-08 ~ 2026-10-09 · 3 条相关
- 新论文测量LLM智能体时间感知,Astra远超其他模型 — maksym_andr · 2026-10-08
- AgentTime 基准:222 任务测 LLM agent 时间感知,Astra 大幅领先 — maksym_andr · 2026-10-08
- 新论文 AgentTime:让 Agent 自主控制运行时长并预测任务耗时 — maksym_andr · 2026-10-09