Anthropic 研究员辞职指控拿人类命运赌博,同期发布 AI 滥用检测报告
AryHHAry · x · 2026-09-11
印尼语作者梳理了两条相关线索:
安全圈争议:Anthropic 研究员 Jacob Coxon 辞职,指控 Anthropic 和 OpenAI 在竞逐可自我改进的超智能时「拿我们的生命赌博」且 safeguards 不足。Anthropic 对齐科学负责人 Evan Hubinger 随即表态支持,称他相信未来 10 年内 AI 灭绝全人类的风险超过 10%。部分 OpenAI 与 DeepMind 研究者也发声呼应。
滥用检测报告:作者建议按读论文的方式(看方法而非标题)阅读 Anthropic 9 月 10 日发布的《Detecting and countering misuse of AI》报告,观察期为 2025 年 12 月至 2026 年 8 月,覆盖网络攻击、舆论操纵、监控、欺诈、生物滥用、常规武器、模型蒸馏 7 个领域。案例中出现的模型以 Haiku、Sonnet、Opus 为主,Fable/Mythos 几乎未出现(仅 1 例蒸馏)。要点:相关行动均被检测并阻止,发现用于收紧 safeguard,部分已共享给监管机构和其他实验室。
所属事件:前Anthropic研究员离职警告AI风险,密集上电视破圈(10 条相关)→
「漫话AGI」频道最新
- 回望 2022:AI 蜂群解千年难题,怀疑论为何还没消失 — birchlse · 2026-09-11
- 「与现实脱节」:一篇文章记录 AI 热潮中的三个离谱 12 小时 — santoshpanda · 2026-09-11
- 逐条给 P(doom) 打分:RSI 必然发生,但毁灭概率未必高 — SydSteyerhart · 2026-09-11
- 2025 年中国新药首发数量全球第一,AI 与速度双引擎驱动 — PatrickKidger · 2026-09-11
- AI 安全争论:早期「狼来了」预警其实是有效的渐进准备 — gandamu_ml · 2026-09-11
- 业界首次拿到实证:模型「知道不对但不在乎」式失齐已现身 — gleech · 2026-09-11