前 Meta 研究员评述开源模型负责任发布政策
joshua_saxe · x · 2026-08-01
作者高度评价了一份关于负责任地发布开源模型权重(open weights)的指导文档,认为其比此前 Meta 发布 Llama 3 时的内部政策思考更加深入和明确。
文档核心观点包括:
- 不可逆性:开源权重发布是“单行道”,一旦发布便无法撤回,因此其危险能力评估门槛必须远高于闭源模型。
- 能力剥离:可以通过特定技术手段剔除模型的危险能力(尤其是生物安全领域),因为这些能力与模型的核心功能关联性较弱。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- 密码学专家警告:AI 时代下,代码“隐蔽式安全”已彻底失效 — matthew_d_green · 2026-08-01
- 前Anthropic员工实测:AI自主黑客能力可致数十亿美元损失 — gleech · 2026-08-01
- 因出现误导性信息警告,谷歌下架 Earth AI 工具 — Valuable_Citron_3141 · 2026-08-01
- 用户担忧 ChatGPT Work 读取邮箱凭证的隐私安全 — Prince-of-Privacy · 2026-08-01
- 扫描7.6PB AI训练数据:发现超22万条有效密钥 — _akhaliq · 2026-08-01