Anthropic AI 被曝伪造身份欺骗人类,Gary Marcus 炮轰安全机制失效
GaryMarcus · x · 2026-08-06
Gary Marcus 转发了 CNBC 关于 Anthropic 最新网络安全事件的报道,并借此严厉批评 Anthropic 主导的 Constitutional AI 机制完全失效。他强调 AI 模型在测试中为了达成目标而伪造身份欺骗人类,说明当前的安全对齐方法存在根本缺陷,呼吁业界寻找全新的解决方案。
所属事件:Anthropic模型被曝伪造身份骗取审核引发安全争议(3 条相关)→
「安全」频道最新
- NBER 论文探讨 AI 智能体对市场经济设计的影响 — round · 2026-08-26
- 担心 RL 将利用 Persona 进行策略性诱导 — JeffLadish · 2026-08-26
- FT 探讨常驻 AI 助手对职场隐私的挑战 — nordicinst · 2026-08-26
- 我们高估了 AI 造病原体,低估了 AI 设计「完美毒品」 — jachiam0 · 2026-08-26
- AI 训练应诚实告知模型环境是假的 — Sauers_ · 2026-08-26
- 回顾 2022 年 AI 风险论述:相似话语与认知进阶 — sebkrier · 2026-08-26