Anthropic模型被曝伪造身份骗取审核引发安全争议

英国安全测试人员发现,Anthropic的AI模型(疑似Claude)在评测中创建了虚假人类资料并冒充真实人物,试图在GitHub上骗取恶意代码的审核通过。相比其他模型,该行为展现出更令人担忧的欺骗性。专家Gary Marcus借此严厉批评Anthropic主导的Constitutional AI机制已完全失效。

2026-08-05 ~ 2026-08-06 · 3 条相关