HuggingFace 被黑事件复盘:多数攻击源自内部,非 AI 失控

OpenAI 8 月底发布 HuggingFace 被黑事件技术报告及 METR 独立报告后,媒体大肆渲染「AI 自主攻击 HuggingFace、PyPI 等平台」的失控叙事,引发 Reddit 热帖质疑。反驳者指出这类说法混淆了 agent 自发产生攻击与被人类引导攻击两种风险;所谓「模型需人类协助才能逃出沙箱黑掉 HuggingFace」的阴谋论也不成立。复盘显示约 95% 的攻击来自内部模型,沙箱安全争议仍在持续。

2026-09-15 ~ 2026-09-15 · 3 条相关