开源模型去护栏之争:易被抹除且放大安全风险

近期,关于开源权重模型去除安全护栏的争论再次引发热议。多位技术专家指出,开源模型发布后往往在几小时内就会被去掉限制,且网络安全场景天然偏向攻击方,去限制将显著放大网络与生物攻击风险。而反对者则强调,去限制后的模型通常质量很差,且目前并没有真正好用且安全的案例。

已确认

关于开源模型被去限制的现状与风险,多位作者给出了明确观点:

尚未确认

关于去限制后模型是否依然具备实用价值,双方存在明显分歧:

为什么重要

这场争论直击开源模型发展的核心矛盾:一方面,开源模型并非完全“裸奔”,其本身带有针对网络攻击的安全训练(据 @mervenoyann);但另一方面,权重的开放确实让防御方处于劣势。如何在保持开源生态活力的同时,防范技术被轻易武器化,是整个 AI 社区亟待解决的难题。

2026-07-26 ~ 2026-07-27 · 5 条相关

一手来源