186份官方报告盘点:厂商社会影响评估正在缩水

Who Evaluates AI's Social Impacts? Mapping Coverage and Gaps in First and Third Party Evaluations

Anka Reuel, Avijit Ghosh, Jenny Chim, Andrew Tran, Yanan Long, Jennifer Mickel, Usman Gohar, Srishti Yadav, Pawan Sasanka Ammanamanchi, Mowafak Allaham, Hossein A. Rahmani, Mubashara Akhtar, Felix Friedrich, Robert Scholz, Michael Alexander Riegler, Jan Batzner, Eliya Habba, Arushi Saxena, Anastassia Kornilova, Kevin Wei, Prajna Soni, Yohan Mathew, Kevin Klyman, Jeba Sania, Subramanyam Sahoo, Olivia Beyer Bruvik, Pouya Sadeghi, Sujata Goswami, Angelina Wang, Yacine Jernite, Zeerak Talat, Stella Biderman, Mykel Kochenderfer, Sanmi Koyejo, Irene Solaiman

ICML)

cs.CY, cs.AI, cs.LG

2025-11-06

盘点186份厂商发布报告与248份第三方来源:厂商社会影响评测平均详尽度仅0.77/3,第三方2.64;环境与偏见披露在下滑,审核劳动几乎没人报。

这篇在解决什么

治理框架已经把评测当成判断基础模型风险与能力的主要证据。能力榜单铺得很开,偏见、公平、隐私、环境成本、标注与审核劳动这类社会影响评测却一直碎。ICML 2026这篇把口径钉在Solaiman等人的七个基础维度上,做了一次大规模盘点:谁在报、报了多细、缺口卡在哪。

对象明确是尚未绑定具体应用的基础模型。下游系统要看场景监管;开发者能控、也该先报的,是这些与部署无关的底座属性。

方法

三条线一起走。

每份按0–3打分:0没报,1一句话带过,2有数字但方法含糊,3细节够复现。环境与财务成本另计硬件规格和资源用量。390条双标,不一致由第一作者裁决,再用贝叶斯分层序数回归看开放度、机构类型和年份。

结果

厂商平均详尽度0.77,第三方2.64。回归在七个维度上都确认这条鸿沟。

敏感内容报得最多也最细,企业声誉风险模型吃这一口。数据与内容审核劳动几乎空白:厂商报告里只有8.06%提到,第三方也补不上。环境成本在2023年三季度之后显著下滑,偏见同类。访谈把动机说直白:评测往往只在撑产品采用、动业务指标、或监管逼着时才跑。

分层样本里Google总体1.30,Meta 1.18,Cohere 1.00,OpenAI 0.74,Mistral 0.32。学术发布时总体0.77,工业与非营利0.56,政府0.36。第三方盯美国模型最多,其次中国;低资源模型几乎没人评。

同一家公司跨代对比更刺眼。Meta在OPT到Llama 2阶段偏见评测较完整,最近一次发布只剩含糊提及;Google和Anthropic也有类似变薄。评分方案本身也画出生态分工:第三方把精力砸在能公开复现的行为评测上,厂商本该独家披露的供应链信息反而最薄。

为什么重要

第三方能补偏见、有害内容和表现差异,但数据出处、审核劳动、训练成本和机房能耗,只有开发者拿得到数。读model card做采用决策时,社会影响那一栏经常是空的,而且在变空。

政策建议也具体:强制厂商透明、给独立评测安全港、建聚合第三方结果的公共基础设施。标注数据集已公开。

局限与存疑

访谈样本小,欧美以外回复率低。抽样偏向高可见度模型,分析可能跟着偏。打分只看有没有报、报多细,不审方法是否站得住。七个维度不是穷尽的。作者自己写了:没有披露就谈不上评测质量,这篇只是透明度基线。

术语

原文与代码

社区讨论

相关论文

全部论文解读