未审查大模型安全争议:学术研究被指混淆性规范与犯罪
一项针对未审查大模型(ULLM)安全性的学术研究引发激烈争议。该论文盘点了229个开源ULLM应用,标出14个恶意方向,并指出部分应用下载量破百万。然而,该研究的分类标准遭到强烈质疑,批评者认为作者将不符合自身性规范的合法行为错误地标记为“犯罪”。
已确认
相关论文聚焦于未审查大模型被用于网络犯罪的风险,研究样本包含229个应用,并在两位标注者达成一致时计入案例(一致性达到 Cohen's κ 标准)。论文指出部分模型应用下载量极高,突破百万级别。此外,论文探讨了 obliteration/abliteration 等去限制化技术,该技术原本旨在让模型生成内容不受限。
尚未确认
关于论文中列举的具体案例是否真正构成“犯罪”或“恶意”,存在严重分歧。@BlancheMinerva 在系列讨论中指出,批评声音认为,让模型模仿希特勒、进行性角色扮演甚至 CSAM 角色扮演等行为,虽然可能令人反感,但本身属于合法行为,不应被定义为犯罪。
为什么重要
这场争论触及了 AI 安全研究的核心边界:如何界定“恶意使用”。@BlancheMinerva 转述的批评观点认为,AI 研究者常把“不同意自己的性规范”等同于“犯罪”,这种道德泛化不仅不道德,还会反过来伤害真正的安全工作。正如讨论中提到的,多数人使用未审查模型是为了获取色情内容而非实施犯罪,将个人好恶与实际犯罪风险混为一谈,可能会导致安全研究偏离重点。
2026-07-28 ~ 2026-07-28 · 5 条相关
一手来源
- 论文盘点 229 个开源 ULLM 应用,标出 14 个恶意方向 — BlancheMinerva ·
- 论文称未审查大模型已被用于网络犯罪,部分下载量破百万 — BlancheMinerva ·
- 研究者争论未审查模型究竟关乎色情还是犯罪 — BlancheMinerva ·
- 【源头】研究者争论未审查模型究竟关乎色情还是犯罪 — BlancheMinerva · 2026-07-28
- 一条回帖称多数人想看色情,不想犯罪 — BlancheMinerva · 2026-07-28
- 【源头】论文称未审查大模型已被用于网络犯罪,部分下载量破百万 — BlancheMinerva · 2026-07-28
- 帖子称模型角色扮演案例属于合法行为而非犯罪 — BlancheMinerva · 2026-07-28
- 【源头】论文盘点 229 个开源 ULLM 应用,标出 14 个恶意方向 — BlancheMinerva · 2026-07-28