前沿模型缺乏时间感,难估算任务耗时

maksym_andr · x · 2026-08-18

前沿模型几乎不具备时间概念,无法估算任务所需时长或已工作时长,也不善于自我评估。相关博客通过 ProgramBench、PaperBench、DeepSWE 等长跨度任务进行了干净实验验证。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →