DeepMind 对齐研究员:十年内 AI 致人类灭绝概率超 10%
vkrakovna · x · 2026-09-11
AI 对齐研究者 Victoria Krakovna(个人身份发言)表示,与许多对齐领域同行一样,她认为先进 AI 在未来十年内导致人类灭绝的概率超过 10%。这正是她从事「失控风险」研究的原因,目前她的具体工作是构建「蜜罐」(honeypots)来捕获会暗中策划(scheming)的 AI——通过设置诱饵场景检测模型是否在表面顺从之下隐藏欺骗性目标。
所属事件:前沿AI从业者称十年内AI灭绝人类风险超10%(2 条相关)→
「安全」频道最新
- Novosad 赞同 Hassabis 的 AI 安全制度构想,反对削弱美国实验室 — paulnovosad · 2026-09-11
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 研究者担忧:美国监管或让 AI 进步「死于集体行动」 — paulnovosad · 2026-09-11