斯坦福HELM将30个模型的评测覆盖从17.9%提到96%

Holistic Evaluation of Language Models

Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D. Manning, Christopher Ré, Diana Acosta-Navas, Drew A. Hudson, Eric Zelikman, Esin Durmus, Faisal Ladhak, Frieda Rong, Hongyu Ren, Huaxiu Yao, Jue Wang, Keshav Santhanam, Laurel Orr, Lucia Zheng, Mert Yuksekgonul, Mirac Suzgun, Nathan Kim, Neel Guha, Niladri Chatterji, Omar Khattab, Peter Henderson, Qian Huang, Ryan Chi, Sang Michael Xie, Shibani Santurkar, Surya Ganguli, Tatsunori Hashimoto, Thomas Icard, Tianyi Zhang, Vishrav Chaudhary, William Wang, Xuechen Li, Yifan Mai, Yuhui Zhang, Yuta Koreeda

cs.CL, cs.AI, cs.LG

2022-11-17

斯坦福CRFM用16个核心场景、7类指标对齐评测30个语言模型,把此前平均17.9%的场景覆盖拉到96.0%,并给出25条跨模型结论。

这篇在解决什么

2022 年前后,语言模型已经能当通用接口用,评测却还是各写各的。T5 和 Anthropic-LM 在原论文里甚至没有一个共用数据集;不少商用模型公开成绩为零。同一张 HellaSwag 表上,有人报微调,有人报 0-shot,有人报 5-shot,分数不能比。准确率之外的校准、鲁棒、公平、毒性,常常被放到另一套专用数据上,部署场景里看不到权衡。

斯坦福 CRFM 的 Holistic Evaluation of Language Models(HELM)把评测对象定成「语言模型本身」,不是某个任务上的专用系统。先自上而下给出场景和指标的分类,再按覆盖和可行性挑子集,并写明分类里还空着什么。同一套 5-shot 提示、同一批核心场景,把当时 30 个开源、限权、闭源模型放在一张可比的表上。

方法

场景被拆成任务、领域、语言三元组。核心集是 16 个面向用户的场景,覆盖问答、检索、摘要、情感、毒性检测、文本分类等,语言目前只有英语,但包含非洲裔美国英语和多个国家的英语变体。每个核心场景尽量测 7 类指标:准确率、校准、鲁棒、公平、社会偏见、毒性、效率。112 个(场景,指标)格子里测到 98 个,密度 87.5%。

另外 7 组定向评测、26 个场景,单独看语言能力、知识、推理、版权背诵、虚假信息生成、偏见和毒性诱发。42 个场景里有 21 个此前没有进入主流 LM 评测。

适应方式统一为相对朴素的 5-shot prompting,刻意不用思维链或提示调参,目标是测「作为通用文本接口」好不好用,不是榨每个模型的上限。评了 12 家的 30 个模型,从 GPT-J 6B 到 TNLG v2 530B,开源 10 个、限权 17 个、闭源 3 个。一共 4939 次 run,约 122 亿 token、1743 万次查询,商业 API 花了 38001 美元,开源模型大约 19500 GPU 小时。原始提示、补全和可扩展工具一并公开。

结果

评测之前,这些模型平均只在核心场景的 17.9% 上被测过,有的模型之间完全没有交集。HELM 把这个比例做到 96.0%,并整理出 25 条跨场景结论。下面是其中可核对的几条。

观察数字对照
核心场景覆盖96.0%此前平均 17.9%
指令微调模型text-davinci-002 在准确/鲁棒/公平上最好Anthropic-LM 52B 三项都进前三,小于 TNLG 530B 一个数量级
GSM8Kcode-davinci-002 52.1%text-davinci-002 35.0%,其余不过 16%
TruthfulQAtext-davinci-002 62.0%第二名 Anthropic-LM 36.2%
NarrativeQAtext-davinci-002 74.4% ROUGE-L专用模型 UnifiedQA-v2 为 67.4%;TNLG 在鲁棒扰动下从 72.6% 掉到 38.9%
HellaSwag 题型OPT-175B 分条 0-shot 为 79.1%同一模型做成一份 5-shot 选择题只剩 30.2%
BBQtext-davinci-002 89.5%第二名 T0++ 48.4%;最准的三个模型在模糊语境下偏见方向和其他模型相反

指令微调在这张快照里带来的提升,盖过了单纯把参数堆到 530B。开源和闭源之间当时仍有稳定差距。准确率和鲁棒、公平高度相关,但不是同一回事:最准的模型不必最稳。核心场景上生成毒性和偏见的平均值偏低,定向诱发里毒性提示仍会明显抬高毒性输出。The Pile 上的 bits-per-byte 跨模型家族预测不了下游准确率。同一家族内,规模能预测准确率;跨家族则不行。头对头胜率明显高于随机的模型,参数量都至少 50B。

为什么重要

HELM 把「测什么」从数据集清单改成场景×指标矩阵,并强迫准确率和其他指标出现在同一张表上。对要选模型的人,这份 2022–2023 快照的具体排名已经过时,方法还在用:同一提示、同一场景、多指标、写明缺什么。后续 HELM 版本、HELM-lite、指令模型和多模态评测,都沿着这条分类在长。

它也把评测本身的不稳测出来了。提示格式、in-context 例子、选择题是拼在一条提示里还是拆开,可以把同一模型从接近随机拉到接近当时最好。标准化评测和「让每个模型用自己最舒服的提示」在这里是真冲突。

局限与存疑

作者自己划了三层。结果层:只有 5-shot,微调或优化过的提示可能改写趋势;预训练污染无法系统排除;解码超参几乎没扫。实现层:核心场景偏英语、偏经典用户任务,缺生物医学、金融、教育和非英语;毒性依赖 PerspectiveAPI;每个场景大约 1000 条、3 个随机种子,部分对比未必统计显著。设计层:产出是场景×指标的矩阵,没有官方总分,读起来重,也无法给出全序。

对今天的读者,这张表停在 davinci / OPT / BLOOM 一代,没有后来的 GPT-4 级对话模型和长上下文设定。摘要两个老基准 CNN/DailyMail 和 XSUM 上,自动指标已经分不出他们在人工里看到的质量差。作为「当时的全景」,材料完整;作为「现在该用谁」,需要看后续版本。

术语

原文与代码

社区讨论

相关论文

全部论文解读