长任务能力让旧评测失效
davidpattersonx · x · 2026-07-12
作者认为,AI 现在可以通过把大任务拆成更小的子任务来完成各种规模的项目,因此 METR benchmark 这类衡量任务长度的指标已经变得不再重要。
引用里举了一个例子:GPT-5.6 Sol 在 Power Atlas 项目上连续工作了 16 小时以上,期间没有触发速率限制,能够持续检索来源、对冲突数据做交叉核对、验证结果,并不断扩展全球能源与数字基础设施地图,且几乎不需要用户介入。作者想强调的重点不是地图本身,而是模型能够长时间保持结构化工作、不陷入循环或丢失目标。
所属事件:网传GPT-5.6可连续工作16小时(2 条相关)→
「漫话AGI」频道最新
- AI 灭亡概率该说 10% 吗:圈内争论风险表述的信誉代价 — paulnovosad · 2026-09-11
- Friston 对谈 Solms:精神分析如何与现代神经科学对话 — MacrinePhD · 2026-09-11
- 超预测者该不该讲模型?davidmanheim 与 Sam_kuyp 激辩预测方法论 — Sam_kuyp · 2026-09-11
- WIRED 深度:递归自我改进浪潮令前沿实验室研究者恐慌,多人辞职发声 — connoraxiotes · 2026-09-11
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- Ultraventures 创始人:AI 跳过钻研过程,「公共知识」或被侵蚀 — jjvincent · 2026-09-11