OpenAI被指拒公开GPT-OSS安全细节引发争议

近期围绕OpenAI发布GPT-OSS时的安全透明度问题,AI社区爆发了一场关于“安全技巧是否应该公开”的激烈争论。Aidan Clark明确表示,虽然团队对帮助外部及开源模型进行安全加固持开放态度,但反对将安全方法本身公开,当前结论是保密有助于防止技术被逆向绕过。此事值得关注,因为它触及了AI安全领域“开源透明”与“保密防御”之间的核心矛盾。

已确认

Aidan Clark确认其团队愿意开展帮助外部模型(包括开源模型)进行安全加固的合作。但他坚持认为,一旦公开具体的安全技巧,这些技术就更容易被他人逆向工程或绕过,因此对分享这些做法持保留态度。

尚未确认

争论的核心焦点在于“不透明是否真的会让世界更危险”。BlancheMinerva对Clark的“保密论”提出强烈质疑。她指出,将风险归因于公开流程并不成立,因为现实中让模型变危险的主要途径是直接微调危险能力,而非了解训练过程本身。她强调,OpenAI拒绝与开源社区交流安全做法、回避透明度,反而会放大风险,靠保密并不能实现真正的AI安全。

为什么重要

这场辩论揭示了头部AI实验室在安全实践上面临的深层悖论:披露安全对齐方法可能被恶意利用,但保持沉默又会被指责危害开源生态。如何在有效防御与社区透明度之间寻找平衡,将是AI安全领域亟待解决的议题。

2026-07-23 ~ 2026-07-23 · 6 条相关

一手来源