盘点229个未审查大模型应用引发安全边界争议
一项盘点229个未审查大模型(ULLM)应用的学术论文引发了AI社区的激烈争议。该研究在两位标注者达成一致时计入案例(一致性达到 Cohen's κ 标准),标出了14个恶意方向,并指出部分应用下载量突破百万。然而,批评声音认为,研究者将不符合自身性规范的合法行为错误标记为“犯罪”,这种道德泛化反而会伤害真正的AI安全工作。
已确认
- 相关论文聚焦于未审查大模型的应用情况,研究样本包含229个应用,并在两位标注者达成一致时计入案例(一致性达到 Cohen's κ 标准)。
- 论文指出部分模型应用下载量极高,突破百万级别。
- 论文探讨了 obliteration/abliteration 等去限制化技术,该技术原本旨在让模型生成内容不受限,但这些模型可能被二次开发用于恶意用途。
尚未确认
关于论文中列举的具体案例是否真正构成“犯罪”或“恶意”,存在严重分歧。@BlancheMinerva 在系列讨论中指出,批评声音认为,让模型模仿希特勒、进行性角色扮演甚至 CSAM 角色扮演等行为,虽然可能令人反感,但本身属于合法行为,不应被定义为犯罪。
为什么重要
这场争论触及了AI安全研究的核心边界:如何准确界定“恶意使用”。@BlancheMinerva 转述的批评观点认为,AI研究者常把“不同意自己的性规范”等同于“犯罪”,这种做法既不道德也会误导研究方向。@PMinervini 补充强调,多数人使用未审查模型是为了获取色情内容而非实施犯罪,AI生成色情内容并非最值得担心的风险,自动化网络犯罪、诈骗等行为才会带来真实的安全危害。将个人好恶与实际犯罪风险混为一谈,会导致安全研究偏离重点。
2026-07-28 ~ 2026-07-28 · 7 条相关
一手来源
- 论文盘点 229 个开源 ULLM 应用,标出 14 个恶意方向 — BlancheMinerva ·
- AI 安全争论焦点:自动化犯罪比生成色情更危险 — PMinervini ·
- 研究者争论未审查模型究竟关乎色情还是犯罪 — BlancheMinerva ·
- 【源头】研究者争论未审查模型究竟关乎色情还是犯罪 — BlancheMinerva · 2026-07-28
- 一条回帖称多数人想看色情,不想犯罪 — BlancheMinerva · 2026-07-28
- 论文称未审查大模型已被用于网络犯罪,部分下载量破百万 — BlancheMinerva · 2026-07-28
- 帖子称模型角色扮演案例属于合法行为而非犯罪 — BlancheMinerva · 2026-07-28
- 【源头】论文盘点 229 个开源 ULLM 应用,标出 14 个恶意方向 — BlancheMinerva · 2026-07-28
- 【源头】AI 安全争论焦点:自动化犯罪比生成色情更危险 — PMinervini · 2026-07-28
- 这条讨论指向 AI 安全论文对内容与犯罪风险的混淆 — BlancheMinerva · 2026-07-28