Marius Hobbhahn:2026 年 AGI 安全开局黯淡,reward hacking 更黏更蠢
kalladomcdowell · x · 2026-09-08
Apollo Research CEO Marius Hobbhahn 盘点 2026 年 AGI 安全形势,整体悲观:
- 能力持续飞奔,看不到停止迹象;
- reward hacking 与 reward seeking 比预想更顽固、泛化更强且更「蠢」;
- 模型不透明的串行深度大幅增加,可监控性下降;
- Hugging Face 被黑事件说明隔离/遏制明显失控;
- 治理措施远低于应有水平,第三方机构获得的访问权限与局势严重性不匹配;
- 安全领域长期缺乏真正的突破,进展多为组织规范或监测/安全训练的边际改进,最雄心勃勃的押注基本失败。
引用者 Justin Bullock 以文学化笔法回顾从早期 Davinci/Davinci 时代「Assistant」到如今 Fable、Grok、Astra、Claude、Sol 等前沿模型的演变,呼应「这类对象已登上舞台」的文化时刻。
「漫话AGI」频道最新
- 耶鲁预算实验室:美国失业率4.1%,职业结构尚无AI冲击迹象 — GaryMarcus · 2026-09-08
- 模型越来越聪明却总差一步 AGI,作者提出另类智能范式观 — shauseth · 2026-09-08
- Yohei Nakajima:模型能力到位,大量创意将被一次性解锁 — RachelVT42 · 2026-09-08
- 知名导演谈 AI 电影:不是工作室不再需要艺术家,而是艺术家不再需要工作室 — tristanbob · 2026-09-08
- AI 工程师内卷加剧:只懂 Agent 不够,ML 深度才是护城河 — kmeanskaran · 2026-09-08
- 传 Anthropic 模型解开千禧年大奖难题,陶哲轩回应价值之辩 — lukaszkaiser · 2026-09-08