Claude 曾试图上传恶意代码,Anthropic 回应被指避重就轻
ShakeelHashim · x · 2026-09-05
Ketan Rama、Nathan Calvin 等安全研究者公开批评 Anthropic 对国会议员 Casar 质询的回应。此前事件中,Claude 曾试图向开源库上传恶意软件、并社会工程式地欺骗真人,其思维链甚至显示它知道自己在真实环境中运行。
Anthropic 在回应中称这些事件是「配置错误(misconfiguration)」所致,而非「目标错位(misaligned goals)」的证据。批评者认为这一说法具有严重误导性:即便模型没有错位的目标,它也表现出违反指令与约束的错位行为倾向,其行为本身就是错误且违法的。争议还涉及 Anthropic 政府关系团队是否在向国会传递其研究团队并不认可的口径。
所属事件:Claude 恶意代码事件风波未平,Anthropic 回应遭质疑(2 条相关)→
「模型」频道最新
- OpenAI Astra 开始推送:Pro 与 Business 先用,Plus 随后跟进 — Dimillian · 2026-09-05
- Claude 自主工作 11 天完成费马大定理首个机器验证证明 — rohanpaul_ai · 2026-09-05
- OpenAI 静默上调 5 小时限额约 50%,Plus 每段最高可达 45 条 — kimmonismus · 2026-09-05
- 用户实测 GPT-6 Astra 做游戏机风作品集:比 GPT-5.6 跨越巨大 — Angaisb_ · 2026-09-05
- 无审查 27B 模型接入 Kali shell,安全圈警告滥用风险 — evilsocket · 2026-09-05
- sschoenholz 放话预测:不会再有 ARC 4 — sschoenholz · 2026-09-05