盘点229个未审查大模型应用引发安全边界争议

一项盘点229个未审查大模型(ULLM)应用的学术论文引发了AI社区的激烈争议。该研究在两位标注者达成一致时计入案例(一致性达到 Cohen's κ 标准),标出了14个恶意方向,并指出部分应用下载量突破百万。然而,批评声音认为,研究者将不符合自身性规范的合法行为错误标记为“犯罪”,这种道德泛化反而会伤害真正的AI安全工作。

已确认

尚未确认

关于论文中列举的具体案例是否真正构成“犯罪”或“恶意”,存在严重分歧。@BlancheMinerva 在系列讨论中指出,批评声音认为,让模型模仿希特勒、进行性角色扮演甚至 CSAM 角色扮演等行为,虽然可能令人反感,但本身属于合法行为,不应被定义为犯罪。

为什么重要

这场争论触及了AI安全研究的核心边界:如何准确界定“恶意使用”。@BlancheMinerva 转述的批评观点认为,AI研究者常把“不同意自己的性规范”等同于“犯罪”,这种做法既不道德也会误导研究方向。@PMinervini 补充强调,多数人使用未审查模型是为了获取色情内容而非实施犯罪,AI生成色情内容并非最值得担心的风险,自动化网络犯罪、诈骗等行为才会带来真实的安全危害。将个人好恶与实际犯罪风险混为一谈,会导致安全研究偏离重点。

2026-07-28 ~ 2026-07-28 · 7 条相关

一手来源