"I Thought You Were The Uncensored Place": Norms, Rules, and Moderation in AI-Generated Sexual Content Communities
Lucy Qin, Jaron Mink, Elissa M. Redmiles
cs.CR
2026-08-14
对三个万人以上、明文禁止滥用内容的 Discord AI 色情社区做 24 人深访:规则几乎只管产出不管基建,反审查与不评判的社区规范把版主的手脚捆在法律与平台条款上。
开源文生图模型(SDXL、Flux)、CivitAI 这类模型仓库加上越狱手段,让任何人都能生成几乎任意形态的色情内容。主流 AI 平台的应对是一刀切禁掉全部相关内容,结果是把创作者推向自组织的 Discord 社区。这些社区大多公开声称反对未经同意的图像与涉未成年内容,但声称归声称,治理实际怎么运转、拦不拦得住,此前没有实证研究看过。Georgetown 与 Arizona State 团队补上这块:2025 年 4 到 8 月访谈了三个大型社区(A、B 侧重图像,各 1 万至 2 万与 5 万以上成员;C 侧重文本)的 24 名成员与版主,全部社区都有针对滥用内容的明文规则。
定性研究。研究者在 Discord 内用相关关键词搜出明文禁止相关滥用内容的活跃社区,先征得版主同意再进组招募,每社区访谈 2 到 14 人,报酬 40 美元。分析走反身式主题分析:三位作者独立编码、合并码本、五份逐字稿三重交叉编码后再分头处理余下材料。框架上借了组织心理学的群体形成理论与 Ostrom 的制度分析,拆成四个问题:社区怎么形成、成员信什么规范、立了什么规矩、治理在哪失灵。
研究做了很重的伦理设计:预设有参与者可能就是施害者,按性暴力研究访谈规范设了有限保密条款,访谈中一旦出现可识别的严重违法情节即终止并上报。实际访谈中有三人自述制作过未经同意的图像,其中一人事后被查实公开发布过可识别受害者的内容,已上报平台并移除。
三条社区规范贯穿全部访谈:
个人与社区层面不是没有防线。多数受访者明确说自己绝不碰涉未成年内容,更少但存在的人拒绝未经同意的图像;三个社区都有禁止发布涉未成年内容的公开规则,且这条规则压过前两条规范。问题出在规则只覆盖产出物:除了文本社区 C 禁止分享可能用于生成涉未成年内容的越狱与提示词,基本没有社区管资产、数据集与知识的流通。而 C 禁了越狱也管不住用途,于是干脆自研限制更严的越狱在社区内分发。
治理缺口由此而来:判断生成图像里角色的年龄靠肉眼,版主只能「宁可错杀」地盯校服、教室这类场景线索;分不清图像里的真人是换脸还是原视频、有没有取得同意;社区大了之后版主每十分钟就得巡视一遍。在一个把反审查与不评判当立身之本的社区里,版主能为删帖找到的唯一正当理由是法律与平台条款,A 社区版主引述成员的质问原话是「以为你们这儿不审查」,他的应对是把执法边界画在合法性上。已有明确刑责的涉未成年内容是硬线,而未经同意的图像在多数法域缺乏同等明确性,版主连删帖理由都说不圆。
论文还点出一个结构性风险:这些社区高度可见、易于搜索、被清平台的概率低,同时又持续积累着与滥用社区高度同构的资源基建(数据、教程、定制工具),有明确个人底线的人在「不问不说」的氛围里也会把滥用当成技术发展的必然副作用接受下来。
这项研究面对的是平台治理与开源模型安全都躲不开的一环:模型层的内容过滤管不住本地部署的开源权重,平台清端把人赶向更极端的角落,社区自治是中间仅剩的干预面。结论对三方面直接有用。做检测的:区分合法创作与滥用要识别生成内容里的真人面孔,这个技术问题至今没有解,裸露检测帮不上忙。做政策的:美国现行法规基本只罚产出与传播,英国新修订的法律把请求定制也入罪,论文支持把监管面从产出扩大到 enabling ecosystem(资产、委托、教程)。做社区产品的:志愿版主没有企业级的审核资源,需要能落地的社会技术工具,而不是更多的平台封禁。
作者自认不具普遍性:只选了有明文规则的社区,三个社区的版主都同意接受研究,这个筛选本身就有偏; knowingly 施害者几乎不会来参加访谈,但访谈里仍然出现了三个自述施害者,说明实际滥用面比样本显示的更宽。定性研究没有效应量,「资产不管控导致滥用」是机制推断,论文没给量化证据。另外全部数据来自自述,版主对规则执行情况的描述无从核实。