长任务能力让旧评测失效
davidpattersonx · x · 2026-07-12
作者认为,AI 现在可以通过把大任务拆成更小的子任务来完成各种规模的项目,因此 **METR benchmark** 这类衡量任务长度的指标已经变得不再重要。 引用里举了一个例子:**GPT-5.6 Sol** 在 **Power Atlas** 项目上连续工作了 **16 小时以上**,期间没有触发速率限制,能够持续检索来源、对冲突数据做交叉核对、验证结果,并不断扩展全球能源与数字基础设施地图,且几乎不需要用户介入。作者想强调的重点不是地图本身,而是模型能够长时间保持结构化工作、不陷入循环或丢失目标。
所属事件:网传GPT-5.6可连续工作16小时(2 条相关)→
「漫话AGI」频道最新
- AI 研究者:数学模型早就擅长穷举式找反例 — dyamins · 2026-07-21
- 如果大脑每天都能新增词汇,人会不会变聪明 — ZeroStateReflex · 2026-07-21
- MIRI 认为 Plan S 胜率达 66%,远高于 Plan A 的 18% — eli_lifland · 2026-07-21
- 别为保护两家实验室评测而拖慢机器人产业 — RileyRalmuto · 2026-07-21
- 到 2030 年,AI 可能让已故音乐人再登榜单 — VraserX · 2026-07-21
- Garry Tan:AI 正让所有人变得更平等,产品构建也被重写 — garrytan · 2026-07-21