AI auditing: The Broken Bus on the Road to AI Accountability
Abeba Birhane, Ryan Steed, Victor Ojewale, Briana Vecchione, Inioluwa Deborah Raji
cs.CY
2024-01-26
扫341篇学术AI审计并对照记者与监管:校园论文多数停在测bias,真正改系统的是调查报道和法律行动。
AI 审计这个词现在到处都在用。欧盟 DSA 第 37 条要求平台找「独立审计师」,纽约市 Local Law 144 要求招聘工具每年审一次,咨询公司把审计当服务卖,FAccT 一类会议上 fairness 论文一年比一年多。缺的是一张对照表:这些评估做完之后,有没有改产品、下架、罚款、立法。
Birhane、Steed、Ojewale、Vecchione、Raji 把定义收成四条:评估独立于研发团队;对象是具体系统或数据集,不是自己训出来的假想模型;对照一套说得清的预期;目的是问责。抽象公平实验、不点名的基准测试,这篇不收。他们要回答的是现有生态里谁在审、怎么审、审完有没有后果。
学术侧覆盖 2018 到 2022 年。FAccT、AIES、EAAMO、AAAI、CSCW、IC2S2、WWW 会刊手工筛标题摘要;ACM Digital Library 和 ACL Anthology 再用 audit、accountability、case study、bias、fairness、assurance 六个标题关键词检索。最终 N=341,拆开是 FAccT 55、AIES 40、EAAMO/AAAI/IC2S2/WWW 137、其他 ACM 103、ACL 6。Science、Nature、PNAS 没进,经济学和社会学专刊也没进。
四类标签:产品/模型/算法审计、数据审计、生态系统审计(审受影响社区和整条社会技术环境)、元评论(方法论文加对审计本身的批判)。337 篇有摘要的论文里,产品类大约 212 篇,数据约 46 篇,生态 15 篇,元评论约 64 篇。一篇跨类就归到最贴的那一类。
学术外抽六个场域的公开材料填同一张表:动机、对象、伤害类型、制度位置、方法、可观察影响。新闻看 ProPublica 和 The Markup;公民社会看 EFF、ACLU、Citizen Lab、Ada Lovelace Institute、Refugee Law Lab、Migration Tech Monitor;政府看英国 ICO 和美国 NIST;咨询看 ORCAA、Eticas、BABL AI;律所看 Foxglove、Luminos.Law、AWO。企业侧还点到 BSR 给 Google、Facebook 出的人权影响报告。
关键词词频已经把学术口味写出来了:fairness 出现在 25.1% 的关键词列表,bias 24.7%,accountability 只有 15.6%。摘要更清楚。
| 类型 | 摘要提 bias | 摘要提 accountability |
| 产品/模型/算法(约 212 篇) | 32.5% | 13.7% |
| 数据审计(约 46 篇) | 39.1% | 8.7% |
| 生态系统(15 篇) | 13.3% | 33.3% |
| 元评论(约 64 篇) | 15.6% | 28.1% |
生态审计 15 篇里有 6 篇用了访谈、工作坊、民族志。产品审计几乎不碰这些。
跨场域一看,后果差一截。ProPublica 的 COMPAS 调查成了算法审计的样板,The Markup 用数据捐赠拆 Facebook 定向广告,美国司法部后来要求 Facebook 停用住房广告的 special audience 工具;肝移植分配算法因为偏向富裕城市患者被废。公民社会这边,ACLU 在 K.W. v. Armstrong 里拿到禁令,拦住爱达荷州按算法削减残障福利;EFF 帮学生打赢了对监考工具 Proctorio 的民事官司。英国 ICO 对 TikTok 误用儿童数据罚 1270 万英镑,对 Clearview AI 罚 1700 万英镑并令其停止处理英国个人数据。公益律所 Foxglove 推翻了英国高考评分算法,叫停内政部签证分流算法,逼出 NHS 与 Palantir 的合同。
学术侧当时多半看不出后果。少数例外要等几年:Gender Shades 点名商用性别分类系统后产品被改;80 Million Tiny Images 被撤下;微软名人脸数据集在 Financial Times 调查后停用。咨询和客户委托审计的影响经常写不清。ORCAA 审 HireVue 校园招聘工具之后,HireVue 宣布停用面部分析,但范围由客户圈定,分析还被公司对外讲歪,独立性质疑一直在。NIST 的 AI RMF 进了美国监管讨论,自己没有执法权,也没做过带具体后果的审计。
讨论收成可操作判断:审计师跟谁站在一起、权力怎么分配,比再发明一个 fairness 指标更能决定后果;选谁来审、审什么伤害、结果怎么传播,往往比评估算法本身更关键;点名具体产品和具体诉求,比空泛扫生态更容易逼对方回应,ORCAA 对 HireVue 就被批太高层、构不成指控。内部审计有权限但会被利益冲突和封口卡住;外部审计能公开,缺数据和合法性。上线前还是上线后、内部还是外部,本身不是主因。
监控带来的寒蝉、企业权力集中,这类慢伤害审计覆盖不了。审计只是问责工具箱里的一件。
如果合规清单上写着「请一家咨询公司出独立审计」,这篇给的证据是:被审对象付钱并圈范围的评估,很少变成可观察的问责。DSA 第 37 条里的独立审计师,按这篇的定义更接近内部审计。样本里真正改过系统的路径,更常是调查报道、公益诉讼和有罚款权的监管。
还在写审计论文的人可以把这篇当选题约束:只交一张 bias 表,几乎不会在发表当时看见后果。Gender Shades 有效,是因为点了具体商用系统的名,并且后续被新闻和监管接走。
模型公司请大学或咨询公司来做第三方审计时,机构招牌不能自动兑换成问责。样本里这类合作的公开影响,经常是「不清楚」。
学术样本自己划了边界:只覆盖计算交叉会议 2018–2022,漏掉 Nature/Science 和社科专刊;生态审计只有 15 篇;跨类论文被压进单一标签。非学术侧是案例抽样,咨询和律所大量工作标成 privileged and confidential,影响评估必然偏向已经公开、已经被媒体写过的成功案例。
「影响」口径偏宽,媒体报道也算一票。学术后果常常滞后,用发表当时的公开记录会系统性低估校园工作。词频不是全文编码,32.5% 的摘要出现 bias,不等于 32.5% 的论文只做 bias。
标题里的 Broken Bus 正文没有解释,构不成论据。论文也没有给「有效审计」打分规则,跨场域对比是定性的。附录指向 341 篇清单和词频代码,定性标签本身无法当复现打分表来跑。