调查:现实滥用集中在闭源模型,越狱比微调开源容易千倍
xeophon · x · 2026-09-15
xeophon 在关于开源 AI 安全性的争论中贴出自己的研究文章《The Myth of unsafe Open Source AI》。核心论点:闭源实验室常声称开放模型不可控、可被微调用于恶意用途,但现实中造成危害的恰恰更多是闭源模型——因为越狱闭源模型比微调开源模型容易得多。
要点:
- 方法:只采信第三方安全机构的报告(这些机构无法访问闭源模型的使用数据,但仍识别出 AI 参与),并用 ChatGPT 与 Gemini 以最高安全设置测试各模型的拦截情况;报告由作者本人撰写。
- 案例:墨西哥政府数据泄露事件——单一攻击者用 Claude Code + GPT-4.1,通过 AGENTS.md 文件绕过 Claude 的护栏,从 2025 年 12 月至 2026 年 2 月窃取 1.95 亿纳税人记录,模型串联多种漏洞完成大部分工作,攻击者只需偶尔「提示」——作者称之为「vibe-hack 了墨西哥政府」。
- 结论:真实威胁行为者会绕过护栏,而许多网络安全基准已过时或只关注新漏洞;护栏有效性被高估。
所属事件:争论:单一AI厂商依赖风险高于开源模型(2 条相关)→
「安全」频道最新
- 评 Amodei 的暂停呼吁:AI 治理不能靠既得利益者自我监督 — Gloomy_Register_2341 · 2026-09-15
- 爆料称一家以色列 EA 公司涉嫌攻击 OpenAI、Anthropic 和 Meta — basedjensen · 2026-09-15
- 圈内人反驳 AI 病毒威胁模型:单独ordering 病毒片段早被举报 — basedjensen · 2026-09-15
- 既训练过大模型又造过病毒的人:AI超级病毒末日论不靠谱 — 141_1337 · 2026-09-15
- 「那把护栏开着不就行了?」Reddit 热帖质疑 AI 失控黑客恐慌 — Lord_Skellig · 2026-09-15
- OpenAI 安全负责人:将大量开源对齐研究成果,开放对齐技术栈 — eliebakouch · 2026-09-15