新论文测量LLM智能体时间感知,Astra远超其他模型
maksym_andr · x · 2026-10-08
一篇新论文系统测量了 LLM 智能体的「时间感知」能力,涵盖时长遵循(duration following)、时间预测与回溯三类任务。
- 作者指出 Astra 在时长遵循上明显优于其他所有模型(见图 1),推测这与它在严格时间受限任务上的训练有关,包括近期若干智能体事故背后的任务;这种更高的时间感知可能是被任务时限「顺带」学到的工具性技能。
- 反例是 Anthropic 的模型:Fable 5.1 无法可靠遵循给定时长,让它工作 4 小时,多数情况下不到 1 小时就结束。
- 作者认为时间感知长期被忽视,但对许多任务尤其是长时运行的智能体非常关键。
所属事件:AgentTime 基准发布:Astra 时间感知大幅领先(2 条相关)→
「编程与Agent」频道最新
- 福布斯发布首份 Agentic 20 榜单:20 家做真活的 AI Agent 公司 — annatonger · 2026-10-09
- 提出 Agent Plasticity:衡量智能体从经验学习的效率,最强者未必最会学 — RulinShao · 2026-10-09
- 用 Claude Code 搭「求职操作系统」:每天 20 分钟精准投递替代 3 小时海投 — aakashgupta · 2026-10-09
- Claude Code 搭建求职系统:每天 20 分钟精准投递取代三小时海投 — aakashgupta · 2026-10-09
- 7 个 AI Agent 并行干活:他 solo 搭建整条业务线 — PrajwalTomar_ · 2026-10-09
- 开源 img2threejs:把参考图重建为纯代码 Three.js 模型,17.7k stars — tom_doerr · 2026-10-09