前沿模型缺乏时间感,难估算任务耗时
maksym_andr · x · 2026-08-18
前沿模型几乎不具备时间概念,无法估算任务所需时长或已工作时长,也不善于自我评估。相关博客通过 ProgramBench、PaperBench、DeepSWE 等长跨度任务进行了干净实验验证。
「研究」频道最新
- 抗体分布预测远易于定位设计,99% 分子到不了靶点 — anshulkundaje · 2026-08-18
- Cell 发表综述:生成式 AI 在细胞生物学面临的 15 大挑战 — jmuiuc · 2026-08-18
- 机器人五大热点:VLA、垂直整合、足式与轮式、Sim 数据 — chris_j_paxton · 2026-08-18
- 工程系求书单:ML/DL 数学基础教材 — Commercial-Kale-5271 · 2026-08-18
- EngramLab 模型以 3.3 倍效率击败 Opus — soumitrashukla9 · 2026-08-18
- 清华 OVOW:单目视频直接转物理仿真 4D 场景 — 机器之心 · 2026-08-18