AgentTime 基准发布:测 LLM 智能体时间感知

新论文 AgentTime 发布,论文、代码与网站均已公开。该基准利用来自 18 个基准的 222 个任务,系统测量 LLM 智能体的时间感知能力,涵盖时长遵循、时间预测与回溯三类任务,并让 Agent 自主控制运行时长、预测任务耗时。结果显示 Google 的 Astra 在时长遵循等方面明显优于其他模型,大幅领先同行。作者 maksymandr 转发了团队对论文的详细解读线程。

2026-10-08 ~ 2026-10-09 · 3 条相关