长任务能力让旧评测失效

davidpattersonx · x · 2026-07-12

作者认为,AI 现在可以通过把大任务拆成更小的子任务来完成各种规模的项目,因此 **METR benchmark** 这类衡量任务长度的指标已经变得不再重要。 引用里举了一个例子:**GPT-5.6 Sol** 在 **Power Atlas** 项目上连续工作了 **16 小时以上**,期间没有触发速率限制,能够持续检索来源、对冲突数据做交叉核对、验证结果,并不断扩展全球能源与数字基础设施地图,且几乎不需要用户介入。作者想强调的重点不是地图本身,而是模型能够长时间保持结构化工作、不陷入循环或丢失目标。

所属事件:网传GPT-5.6可连续工作16小时(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →