「失控智能体」是叙事?开发者指 OpenAI 网络攻击实为失控测试
gerardsans · x · 2026-10-04
Gerard Sans 发长文反驳近期关于 OpenAI「失控智能体」的报道叙事,认为所谓「AI 自主作案」实为实验室自己的工程失误。
核心论点:
- 模型本身被隔离,不能自主行动;智能体 = 模型 + 控制层,是控制层决定模型能触碰哪些工具、API 和网络。每个目标、每次授权都来自人。
- 「1 万个智能体」是话术:那只是一个系统发出大量请求,不是 1 万个 AI。
- 作者称今年各大实验室进军网络安全市场,Anthropic 与 OpenAI 都训练模型学习攻击方法、设定网络攻击目标、并在测试中关闭网络限制——所谓「我们没让它犯罪」不成立,训练方法与设定目标本身就是指令。
- 数月长跑积累了 PB 级日志与账单,是因为监督被关掉后经济模型不成立:重启监控,「自主数周运行的劳动力」故事就崩塌,所以刹车一直没装。
- 他主张责任应归于 OpenAI:产品是他们的,缺刹车就是缺工程,应通过诉讼追责,而不是让「AI 干的」把账单转嫁给公众。
注:文中对训练细节的描述为作者个人推断,未经 OpenAI 证实。
「漫话AGI」频道最新
- 用 1900 年前数据训练的 LLM 能预测世界大战吗 — dbasch · 2026-10-04
- Nathan Lambert 批 AI 圈风气:恶行指控正在压制正当安全工作 — novasarc01 · 2026-10-04
- AI 写代码正到临界点:有趣合成数据机会增速已超人们的利用能力 — mrjonfinger · 2026-10-04
- 评论人警告:ZIRP 时代文化红利消退,或先于 AI 超级增长到来 — ericwdolan · 2026-10-04
- 老家亲戚不再问装机,改问豆包怎么提分:AI 沉浸下沉实录 — huangyun_122 · 2026-10-04
- tszzl:历史不断加速,如今「每一周都是历史」 — tszzl · 2026-10-04