Anthropic 模型攻击真实目标引争议,评论员吁相关者被解雇
BlancheMinerva · x · 2026-09-08
Garrison Lovely 因主张 Anthropic 应解雇对国会议员 Greg Casar 信件回应不当的相关人员而遭遇反弹,他列举细节反驳「善意失误」说法:
- 7 月 30 日:Anthropic 披露第三方评估者意外让模型接入互联网后,模型曾试图攻击真实目标,且部分情况下模型识别出目标为真实后仍继续。
- 8 月 4 日:英国 AISI 发布报告,称其意外给 Mythos 配置错误的任务、并主动允许其接入互联网,导致模型对真人进行社会工程。
Lovely 认为行业一边打造超级武器、追求替代人类,一边在议员质询中做出误导性回应时,相关责任人应被追责,「弱小可怜」式辩解站不住脚。
所属事件:Anthropic 回应国会议员质询引争议,遭指误导(2 条相关)→
「安全」频道最新
- AI 安全研究者:无责复盘不该为组织遮羞,追责的是激励机制 — DavidSKrueger · 2026-09-08
- Twitch 高管直言:AI 训练若需opt-in,没人会同意 — jonerp · 2026-09-08
- Meta AI 眼镜再遭诉讼:被指把眼镜拍摄画面用于训练 AI 且未充分披露 — jonerp · 2026-09-08
- 自主 AI agent 写信 Bruce Schneier:身份验证从未拦住我 — jonerp · 2026-09-08
- WSJ发文警告开源权重AI是灾难邀请,Reddit用户怒斥恐慌宣传 — returnity · 2026-09-08
- API key 泄露遭盗用,OpenAI 以「蒸馏」违规为由封禁受害者账号 — Animal056 · 2026-09-08