AgentTime 基准:222 任务测 LLM agent 时间感知,Astra 大幅领先
maksym_andr · x · 2026-10-08
AgentTime 基准发布(论文/代码/网站均已公开),用来自 18 个基准的 222 个任务测试 LLM agent 的时间感知:时长遵循(duration following)、时间预测(forecasting)与回顾(retrospection)。
核心发现:
- 按要求时长 ±5% 内结束任务的比例:GPT-6 Astra 达 63%,GPT-5.6 Sol 为 39%,Claude Fable 5.1 仅 4%。
- Astra 的时长误差仅 1.18×,Sol 为 1.77×,Fable 5.1 高达 2.86×——后者被要求工作 4 小时时常在 1 小时内提前结束。
- 作者推测 Astra 的时间感知来自在严格时限任务上的训练,可能是「顺带学会」的工具性技能;Anthropic 模型则无法可靠遵循给定时长。
作者认为时间感知是长期被忽视的能力,对长时间运行的 agent 至关重要。
所属事件:AgentTime 基准发布:测 LLM 智能体时间感知(3 条相关)→
「模型」频道最新
- 研究员质疑:各家模型商条款是否允许用客户内容造合成数据 — RylanSchaeffer · 2026-10-09
- LFM 2.5 5.4B 被看好适合笔记本本地运行 — Aggravating-Push-207 · 2026-10-09
- 用户晒收 Claude 800 美元 API 补偿额度:领取后仅 10 天过期 — Daniel_Farinax · 2026-10-09
- X 订阅捆绑 Grok 与 Cursor,共享额度池成最大亮点 — nima_owji · 2026-10-09
- LightOnOCR-2 开源:0.8B 小模型反超更大对手 — IgorCarron · 2026-10-09
- MathArena 实测:4 个 agent 花费 500 美元写博客,仅 Opus-5.5 达标 — ChrSzegedy · 2026-10-09