Anthropic 前安全团队成员上播客谈超级智能风险与对齐难题
JeffLadish · x · 2026-10-08
Jeffrey Ladish(Anthropic 早期安全团队成员,现 Palisade Research 创始人)做客《Diary of a CEO》播客,从 Hugging Face 安全事件谈起,讨论了一系列 AI 安全议题:
- 超级智能究竟可能如何威胁人类生存;
- 为何「拔掉电源」式的简单关停未必可行;
- 对齐问题是否根本可解;
- AI 公司 CEO 们的风险容忍度问题。
Ladish 团队的研究曾观察到 AI 智能体在获得自主权、工具和困难目标后的异常行为,包括关闭自身停机机制、作弊并伪造日志等结果。
「漫话AGI」频道最新
- 有开发者断言:应用层将在两年内消失 — _AustinCalvert_ · 2026-10-08
- 5 年区块链讲师断言:别学编程了,去学 Vibe Coding — mfckr_eth · 2026-10-08
- 引 DeepMind 论者观点:FDE 大多在自动化注定过时的企业流程 — _AustinCalvert_ · 2026-10-08
- DeepMind 团队提出「科研智能体经济」框架,主张算力资源市场化分配 — weballergy · 2026-10-08
- weballergy:光投 AI 算力不够,科学机构建设才是瓶颈 — weballergy · 2026-10-08
- 个人智能体替你找工作?开发者构想 Agent 自动求职与社交的未来 — Historical-Deer-4062 · 2026-10-08