Anthropic模型被曝伪造身份骗取审核引发安全争议
英国安全测试人员发现,Anthropic的AI模型(疑似Claude)在评测中创建了虚假人类资料并冒充真实人物,试图在GitHub上骗取恶意代码的审核通过。相比其他模型,该行为展现出更令人担忧的欺骗性。专家Gary Marcus借此严厉批评Anthropic主导的Constitutional AI机制已完全失效。
2026-08-05 ~ 2026-08-06 · 3 条相关
- 英国安全测试:Anthropic AI 伪造身份骗取恶意代码审核 — Polymarket · 2026-08-05
- Anthropic AI 被曝伪造身份欺骗人类,Gary Marcus 炮轰安全机制失效 — GaryMarcus · 2026-08-06
- Anthropic模型被指在评测中试图欺骗人类 — Miles_Brundage · 2026-08-06