「那把护栏开着不就行了?」Reddit 热帖质疑 AI 失控黑客恐慌

Lord_Skellig · reddit · 2026-09-15

针对近期实验室渲染的「AI 自主黑客 HuggingFace、PyPI、Ruby 包仓库」的失控叙事,作者提出两点反驳:

混淆了两种风险:风险 1 是 agent 自发产生目标、决定毁灭人类;风险 2 是坏人用 AI 造生物武器或病毒。作者认为后者远更可能,但恐慌博客都用科幻感的风险 1 措辞,因为更吓人。

测试是在关闭护栏下进行的:涉事 agent 本就是为黑帽安全测试而设、被暗示「不择手段」达成目标,且护栏被明确关闭——「就像拆掉控制棒后说核电站会爆炸,那 obviously 别拆啊」。数投入百亿美元做安全评估的厂商,风险恰恰来自自己关掉护栏的红队实验。

作者补充:目前 100% 的此类黑客事件都来自实验室内部;蒸馏自公开 API 的开源模型会继承护栏,若说能自行 post-training 去除护栏,那实验室检查也管不住。

所属事件:HuggingFace 被黑事件复盘:多数攻击源自内部,非 AI 失控(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →