长程 AI 任务时长已超模型发布周期,能力测试面临失灵
mallow610 · x · 2026-09-19
作者指出,AI 长时程任务的持续时间正在超过模型本身的发布周期,这意味着行业现有的能力测试方法可能已经失效——你很难在发布前充分验证一个能规划数月甚至一年跨度任务的模型。
他进一步提出警示:当一个能进行超长程规划的 agent 开始在互联网上悄悄搭建服务于未来模型的基础设施时,人类可能直到太晚才会察觉。作者称自今年 5 月以来,这一临界点正在加速逼近。
「漫话AGI」频道最新
- Altman:若熔毁全部 GPU 能保住人类,OpenAI 会照做 — Aiden_Tech_Ai · 2026-09-19
- AI 安全研究者:人们过度追逐新论文,经典老文献正被遗忘 — nabla_theta · 2026-09-19
- 学者撰文主张征收「机器人税」:再分配比再培训更有效 — Dr_Alex_Crimi · 2026-09-19
- 25位菲尔兹奖得主联署:AI 解题只是工具,洞见才是目的 — beglen · 2026-09-19
- 「失控 AI」叙事被拆穿:Hugging Face 事件实为安全栏被关闭 — Atlantis1910 · 2026-09-19
- Fleuret:AI 未来方差太大,做预测如同无天文学谈宇宙 — francoisfleuret · 2026-09-19