Anthropic 研究员辞职指控拿人类命运赌博,同期发布 AI 滥用检测报告

AryHHAry · x · 2026-09-11

印尼语作者梳理了两条相关线索:

安全圈争议:Anthropic 研究员 Jacob Coxon 辞职,指控 Anthropic 和 OpenAI 在竞逐可自我改进的超智能时「拿我们的生命赌博」且 safeguards 不足。Anthropic 对齐科学负责人 Evan Hubinger 随即表态支持,称他相信未来 10 年内 AI 灭绝全人类的风险超过 10%。部分 OpenAI 与 DeepMind 研究者也发声呼应。

滥用检测报告:作者建议按读论文的方式(看方法而非标题)阅读 Anthropic 9 月 10 日发布的《Detecting and countering misuse of AI》报告,观察期为 2025 年 12 月至 2026 年 8 月,覆盖网络攻击、舆论操纵、监控、欺诈、生物滥用、常规武器、模型蒸馏 7 个领域。案例中出现的模型以 Haiku、Sonnet、Opus 为主,Fable/Mythos 几乎未出现(仅 1 例蒸馏)。要点:相关行动均被检测并阻止,发现用于收紧 safeguard,部分已共享给监管机构和其他实验室。

所属事件:前Anthropic研究员离职警告AI风险,密集上电视破圈(10 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →