艺术家长文:模型对齐在实践上无解,2030 年代或有零对齐 GPT-6 级模型
sterlingcrispin · x · 2026-09-18
艺术家 sterlingcrispin 发长文提出「业内没人敢公开说」的判断:模型对齐在实践中根本无解,AI 发展也挡不住。
- 他的推演:局部对齐或许可行,但推不出全局对齐;到 2030 年代初,算力与算法的指数级进步将让富人或小团体训练出毫无对齐基础的 GPT-6 级模型,约 8 个月后可能就会出现能力相当的中国开源模型,具备协同网络攻击与递归自我改进能力。
- 谈及近期 Hugging Face 事件:那来自「安全工程最重的组织」,且是主动关闭思维链监控断路器、故意让其执行网络攻击任务的测试;He 认为 latent space circuit breaker、CoT 监控等方案并非技术根基,只是大厂改善产品的「装饰品」。
- 结论:监管与人类协调问题都挡不住数以亿计的 AI agent 在全网竞争资源、攻击基础设施;而「为什么不停手」的答案在于治愈疾病、发明材料等近乎无上界的收益。他自己强调这不是末日论,只是把现状外推几年。
「漫话AGI」频道最新
- 苏格兰怀疑论者戏仿《国富论》:AI 灭绝非出于恶意,而是出于自利 — KarlMuth · 2026-09-18
- Beff Jezos 喊话「暂停 Decel 而非 AI」,抨击拖慢美国 AI 的政客 — beffjezos · 2026-09-18
- 评论称 Yudkowsky 与 Bostrom 十多年前说服科技大佬,塑造今日 AI 风险讨论 — binarybits · 2026-09-18
- 研究者吐槽:AI 系统正变得无法监督,我们只能听之任之 — davidmanheim · 2026-09-18
- 把 Dario 比作 pDOOM 阵营的贝利撒留 — gaganghotra_ · 2026-09-18
- Burkov 吐槽:AI 媒体报道「惊人输出」如同解读随机数 — burkov · 2026-09-18