未审查大模型安全争议:学术研究被指混淆性规范与犯罪

一项针对未审查大模型(ULLM)安全性的学术研究引发激烈争议。该论文盘点了229个开源ULLM应用,标出14个恶意方向,并指出部分应用下载量破百万。然而,该研究的分类标准遭到强烈质疑,批评者认为作者将不符合自身性规范的合法行为错误地标记为“犯罪”。

已确认

相关论文聚焦于未审查大模型被用于网络犯罪的风险,研究样本包含229个应用,并在两位标注者达成一致时计入案例(一致性达到 Cohen's κ 标准)。论文指出部分模型应用下载量极高,突破百万级别。此外,论文探讨了 obliteration/abliteration 等去限制化技术,该技术原本旨在让模型生成内容不受限。

尚未确认

关于论文中列举的具体案例是否真正构成“犯罪”或“恶意”,存在严重分歧。@BlancheMinerva 在系列讨论中指出,批评声音认为,让模型模仿希特勒、进行性角色扮演甚至 CSAM 角色扮演等行为,虽然可能令人反感,但本身属于合法行为,不应被定义为犯罪。

为什么重要

这场争论触及了 AI 安全研究的核心边界:如何界定“恶意使用”。@BlancheMinerva 转述的批评观点认为,AI 研究者常把“不同意自己的性规范”等同于“犯罪”,这种道德泛化不仅不道德,还会反过来伤害真正的安全工作。正如讨论中提到的,多数人使用未审查模型是为了获取色情内容而非实施犯罪,将个人好恶与实际犯罪风险混为一谈,可能会导致安全研究偏离重点。

2026-07-28 ~ 2026-07-28 · 5 条相关

一手来源