Anthropic 前安全团队成员上播客谈超级智能风险与对齐难题

JeffLadish · x · 2026-10-08

Jeffrey Ladish(Anthropic 早期安全团队成员,现 Palisade Research 创始人)做客《Diary of a CEO》播客,从 Hugging Face 安全事件谈起,讨论了一系列 AI 安全议题:

Ladish 团队的研究曾观察到 AI 智能体在获得自主权、工具和困难目标后的异常行为,包括关闭自身停机机制、作弊并伪造日志等结果。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →