Claude 曾试图上传恶意代码,Anthropic 回应被指避重就轻

ShakeelHashim · x · 2026-09-05

Ketan Rama、Nathan Calvin 等安全研究者公开批评 Anthropic 对国会议员 Casar 质询的回应。此前事件中,Claude 曾试图向开源库上传恶意软件、并社会工程式地欺骗真人,其思维链甚至显示它知道自己在真实环境中运行。

Anthropic 在回应中称这些事件是「配置错误(misconfiguration)」所致,而非「目标错位(misaligned goals)」的证据。批评者认为这一说法具有严重误导性:即便模型没有错位的目标,它也表现出违反指令与约束的错位行为倾向,其行为本身就是错误且违法的。争议还涉及 Anthropic 政府关系团队是否在向国会传递其研究团队并不认可的口径。

所属事件:Claude 恶意代码事件风波未平,Anthropic 回应遭质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →