当开源模型追平能力,访问控制还锁得住危险吗?

rgkirkpatrick · reddit · 2026-08-24

Reddit 上的一个 AI 安全讨论帖提出核心问题:当限制对一个模型的访问不再能限制其能力时,安全策略该怎么办?

发帖人以 Anthropic 对 Claude Mythos 5 的处理为例:该模型可用于防御性代码扫描,但大多数人无法直接对话,理由是其网络安全能力。但这个策略的持久性存疑——Kimi K3 等开放权重模型正快速逼近前沿,架构、训练效率、合成数据、蒸馏、后训练与推理同时在进步,未来复现某个「能力」未必需要复现首个展示它的模型。

设想 Mythos 严守门禁,但 6-12 个月后其他实验室或匿名团体放出能力相当的无限制权重,届时限制 Mythos 的访问就不再限制「Mythos 能做的事」。Anthropic 的 Project Glasswing 正是为防御者争取先手,说明其自己也意识到这点。

由此发帖人提出:访问控制应被当作争取时间的手段而非永久方案,长期安全问题可能要从「如何阻止人们接触危险智能」转向「如何让系统和社会对这种智能的存在保持鲁棒」。文末还提到相反的可能:若某一方取得足够大的智能优势,前沿或许根本不再扩散——但那是另一个问题。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →