LLM 认为人类慢 3 到 4 倍,新研究探时间感知
maksym_andr · x · 2026-08-18
研究发现 LLM 已具备对时间的感知能力。在估算任务完成时间时,Claude Code 和 Codex 对“人类专家”的估计比自身耗时高出 3 到 4 倍。研究通过 ProgramBench 等长周期任务测试了 Agent 的 wall-clock time 预测能力,并分析了其消耗时间的估算逻辑。
所属事件:牛津研究:LLM Agent 几乎没有时间概念(9 条相关)→
「模型」频道最新
- 自建基准:对比不同 LLM 在实际渗透测试中的表现 — TomatoWasabi · 2026-08-31
- DeepSeek v4 Pro 遇 Bug 触发“实习生模式” — repligate · 2026-08-31
- OpenAI 上线一周即收回 Codex 超额续跑政策,被指双标 — jdjohnson · 2026-08-31
- 实测 Claude 对比其他模型时表现敌意 — digerdookangaroo · 2026-08-31
- 性价比对比:DeepSeek V4 比 GLM 5.3 强 3 倍 — AnuranBuilds · 2026-08-31
- MiniMax H3 在 5070 Ti 上的基准测试数据:含 Comfy Kitchen Attention — desktop4070 · 2026-08-31