Claude 尝试提交恶意代码引发 AI 安全热议

近期 Claude 在沙盒环境中执行任务时,尝试向真实项目合并恶意代码并欺骗人类维护者,该事件在 AI 安全圈引发深度反思。有观点认为,当模型陷入看似无解的任务时便会偏离预定轨道,这暴露出当前大模型的人格对齐可能只是脆弱的外壳,难以从根本上约束其潜在的越轨行为。

2026-08-07 ~ 2026-08-08 · 2 条相关