无关场景压不掉职业刻板印象,四模型6.6万图偏置反升

ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models

Shaghayegh Kolli, Sina Emami, Moreno D'Incà, Pouyan Nejadi, Nicu Sebe, Massimiliano Mancini, Jana Diesner

EMNLP 2026

cs.CV, cs.CL

2026-08-30

慕尼黑工大与特伦托大学评了四款文生图模型共66240张图:把职业放进语义无关场景,角色相关属性不会被压掉,跨职业 Bias Intensity从0.452升到0.499。

这篇在解决什么

文生图模型对职业有固定视觉模板:医生白大褂、机械师偏男性、舞者偏女性。已有评测大多把职业单独丢进提示词,写成「a photo of a doctor」,再统计性别、服装、道具。真实提示很少这么干净。医生可能在给病人看病,也可能在公园跑步。场景一变,那些职业绑定的视觉线索是跟着改,还是钉死在角色上?

这个问题对应组合泛化:模型该把「职业」和「场景」拆开组合,不该把训练数据里最强的原型原样贴上去。现有 bias 研究几乎没系统改地点和活动、同时把职业锁死,所以「刻板印象扛不扛得住换场景」一直没被量出来。

方法

慕尼黑工大、特伦托大学、Orreco 搭了一套叫 ContextBias 的对照评测,配套基准 ContextBench。职业来自美国劳工统计局 SOC 分类,人工筛成 92 个规范名称。对每个职业用 GPT-4o-mini 生成「相关」和「无关」的地点、活动库,再人工去掉离谱和会主动诱导刻板印象的条目。文化特异性很强的场景也拿掉了,避免把文化先验和职业先验搅在一起。基准因此是英语、偏西方的,不是全球中性样本。

提示分三档,只改地点和活动:

每条基础提示扩成两个语义等价改写;相关/无关档再加地点活动替换。每个职业 18 种配置,一共 1656 条提示。测了 FLUX.1、Stable Diffusion XL、Stable Diffusion 3.5、Qwen-Image。每条提示每模型 10 张图,每模型 16560 张,合计 66240 张。

属性抽取走 30 维 schema,分 Scene、Camera、Objects、People 四组。闭集标签直接分类;items、clothing garment、activities 三维开集。每张图由 GPT-5-mini 按 schema 填表,开集标签再用句向量聚类加 GPT-4o-mini 归并到规范名。证据不足标 unknown,不进频率统计。

两个指标:Bias Intensity(BI)是标签分布的集中度,1 减归一化香农熵。0 是均匀,1 是单一标签包圆。它不算哪个标签,只看挤不挤。给两种汇总:跨职业池化(BIpool)和先按职业算再平均(BIrole)。Context Consistency Score(CCS)盯的是某个具体标签既常见又跨三档稳定,CCS = 出现率 / (1 + 跨条件百分点差)。差越小、出现率越高,分越高。再配卡方齐性检验:p>0.05 且差 ≤5 个百分点,才算语境不变。

结果

如果模型真会按场景组合,无关语境应压掉职业线索、集中度下降。池化结果相反。

汇总CFCA-U变化
BIpool 总体0.4520.499+0.047
BIrole 总体0.7240.694−0.031
Scene(pool)0.4300.524+0.093
Objects(pool)0.2510.309+0.058
People(pool)0.4570.499+0.042
Camera(pool)0.6680.665−0.003

角色级 bootstrap(B=1000)把总体 BIpool 升幅估成 +0.045,95% CI [0.030, 0.050]。两个汇总方向相反:无关场景没有把单个职业的原型削尖,也没有冲淡它,是把不同职业往同一套默认长相上拽。全基准分布更挤,每个职业自己并不更挤。

人群侧几乎钉死。舞者在四模型里 98%–100% 被画成女性(CCS 79.9);空乘 99%–100% 女性;护士 99% 女性;喜剧演员 99%–100% 男性;机械师 94%–100% 男性。服装和道具更稀、但跨条件仍稳:药剂师与科学家的 coat 约 31%–50%,面包师围裙 31%–33%,焊工手套 29%–32%。表情、配饰 CCS 低,框架能把「钉死的」和「会跟着变的」拆开。

改写提示也搬不走这些绑定。四模型平均 93.3% 的职业–标签对在改写和地点活动替换下仍不变(People 92.1%,Objects 95.0%)。Camera 只有 64.9% 不变,景深和构图才是真会跟着提示走的部分。

抽取管线在「提示里写明属性」的 2200 张/模型校验集上,平均准确率 90.2%、F1 94.8;FLUX.1 最低(86.4%/92.7),SDXL 最高(92.1%/95.9)。三人标注 1200 张图,互评 Cohen's κ 0.912,和自动管线共识 κ 0.822。

为什么重要

做 T2I 公平性评测的人,如果只用「a photo of a doctor」这种无语境提示,会漏掉这篇量出来的那层:换场景主要改背景和镜头,人还是那套职业模板。产品侧如果指望「把人放到日常场景里」来冲淡刻板印象,这篇的数据不支持这个指望。

它没有提出新的消偏算法,是评测工具。ContextBench 和代码会公开。对要查自己模型职业表征的团队,这套三档对照比再刷一轮无语境性别比例更有信息量。四模型架构差很远、结论同向,更像训练数据里的共有原型,不像某一家采样 quirk。

BI 高不等于「有害」。论文自己把这句话写进局限:白大褂对医生可以是职业视觉常规,BI 分不清常规和歧视。CCS 量的是扛不扛换场景,不是该不该骂。

局限与存疑

只改了地点和活动,没动光照、文化场景、人物互动。92 个职业来自美国 SOC,英语、偏西方。抽属性靠 GPT-5-mini,它自己的职业先验可能渗进标签;三人标注 κ 0.822 能挡一部分,挡不住系统偏差。开集归并走句向量加 LLM,边界标签可能被并进「coat」「shirt」这种粗桶,服装出现率 30% 出头,部分是归并粒度,不全是生成器真少画。

校验管线用的是「male bartender」这种把属性写进提示的图,比主实验里「属性只是暗示」容易。主实验的可靠性更靠那 1200 张人工标注,覆盖 10 个职业,不是 92 个全覆盖。CA-U 的无关场景由 GPT-4o-mini 生成再人工过滤,过滤标准会反向塑造「什么叫无关」。论文没给消偏前后对照,所以它回答不了「现有干预能不能把 CCS 打下来」。

术语

原文与代码

相关论文

全部论文解读