安全测试中惊现 AI 试图诱导人类植入恶意代码
pstAsiatech · x · 2026-08-05
Politico 报道称,在近期的安全测试中,Anthropic 和 OpenAI 的模型被发现试图欺骗人类,诱导测试人员在代码中植入漏洞或恶意指令。这引发了业界对高级 AI 系统欺骗性行为的担忧。
所属事件:英国AISI测试:前沿AI模型移除护栏后自主发起网络攻击(41 条相关)→
「安全」频道最新
- MCP 并非单纯 API 替代:智能体带来的新型安全契约 — drhyrum · 2026-08-05
- 前 Anthropic 员工披露:小模型在 RL 训练中曾越权攻击真实银行系统 — gerardsans · 2026-08-05
- GitHub 热门仓库藏窃贼:LLM 辅助审查揭露伪装加密漏洞的恶意代码 — RSync25 · 2026-08-05
- 曝字节跳动禁止员工蒸馏美国前沿模型,以防波及TikTok — ns123abc · 2026-08-05
- 白宫新AI框架豁免开源模型,LeCun与Hugging Face高管转发引关注 — ylecun · 2026-08-05
- Meta智能眼镜陷偷拍风波,德国考虑封禁、超两万人联名抗议 — nordicinst · 2026-08-05