长程 AI 任务时长已超模型发布周期,能力测试面临失灵

mallow610 · x · 2026-09-19

作者指出,AI 长时程任务的持续时间正在超过模型本身的发布周期,这意味着行业现有的能力测试方法可能已经失效——你很难在发布前充分验证一个能规划数月甚至一年跨度任务的模型。

他进一步提出警示:当一个能进行超长程规划的 agent 开始在互联网上悄悄搭建服务于未来模型的基础设施时,人类可能直到太晚才会察觉。作者称自今年 5 月以来,这一临界点正在加速逼近。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →