Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-Tuning
Ahmed Elshabrawy, Yongxin Huang, Iryna Gurevych, Alham Fikri Aji
cs.CL
2024-04-19
把16个NLU任务改写成自然语言真假陈述来微调RoBERTa,355M模型在7项未见或换域评测上零样本平均准确率75.3,超过Llama-3-70B的70.5。
解码器大模型能零样本做题,靠的是参数量和指令微调。编码器如 BERT、RoBERTa 在分类和 NLI 上微调后很强,但任务头绑死了标签空间,换一道没见过的题就废。PET 一类方法用填空模板把下游任务拧回预训练目标,零样本主要吃预训练本身,吃不到多任务指令微调那一档迁移。
MBZUAI 和达姆施塔特工大把这件事做成 Statement-Tuning:任何有限标签的判别任务都改写成自然语言真假陈述,用一个二分类头判断陈述对不对。多任务训完,新任务只要也能写成陈述,就能零样本选标签。
训练侧把 16 个数据集、9 类任务穷举成陈述,覆盖 QQP、MNLI、SQuAD、PiQA、Yelp 等。每条样本按标签模板生成多句,正确标签对应 True,其余 False。RoBERTa 加标准序列分类头,学的是这句话是不是真的。
推理时给每个候选标签各造一句陈述,取 True 概率最高的那个。零样本直接用多任务模型;K-shot 再在目标任务的陈述上继续微调。
设计选择有三处。陈述比「文本加标签拼接」和「前提-假设」更通用,不是所有判别任务都能写成蕴含。训练数据按任务均匀抽样,true/false 和原类别都平衡,避免大任务淹没小任务。每个数据集多套模板,逼模型看语义而不是套话。
7 个评测集里,BCOPA、FigQA、StoryCloze、Emotion、Yahoo Answers 是未见任务;MRPC、Amazon Polarity 是见过任务换了域。
| 模型 | 参数 | 零样本平均准确率 |
| Llama-3-70B-Instruct | 70B | 70.5 |
| Qwen1.5-7B-Chat | 7B | 70.9 |
| RoBERTa-base (Best) | 125M | 67.1 |
| RoBERTa-large (Best) | 355M | 75.3 |
355M 的 RoBERTa-large 平均比最强开源对照 Qwen1.5-7B-Chat 高 4.4,比 Llama-3-70B 高 4.8。FigQA 上 74.2 对 Llama-3 的 42.0,多 32.2 点;StoryCloze 上 92.1 对 82.7,多 9.4 点。BCOPA 和 Amazon Polarity 上,零样本已经接近全量微调。
数据量很省。每个训练集聚 1000 条陈述,RoBERTa-base 平均 63.0,已经是最优 65.4(每集 4000 条)的 96%。加到 5 万条,base 掉到 58.5;large 过了 1 万条也开始掉,过拟合训练任务。任务种类从 3 类加到 9 类,几何平均从 26.0 拉到 61.2。模板多样性对均值帮助不大,但对稳定性有用:每类 1 套模板标准差 6.9,3 套降到 3.0。
极端少样本继续微调陈述模型,通常优于从零微调 RoBERTa。数据一多,直接微调原模型更强。
这是 2024 年的一篇「小编码器也能零样本」论证。任务若是有限标签 NLU,不一定要上 7B 解码器。125M 到 355M 的编码器,用陈述格式做多任务二分类,零样本就能打进当时开源 7B 到 70B 的区间,尤其常识选择题。训练预算大约 1.6 万条陈述就能动。
适用面很窄但明确:标签集合有限、要低延迟、没有生成需求。线上每个标签一次前向,标签一多就贵。
论文自己写了:每个标签一次前向,多分类成本线性涨;有充足标注时全量微调仍然更强;对训练量和其他超参敏感;只做了英文;编码器干不了翻译和生成式摘要。
对照实验的公平性要打折。Llama-3 和 Qwen 的预训练语料可能已经见过评测集,论文自己也提了 contamination。评测是 7 个分类或选择题,没有阅读理解生成,没有长上下文。RoBERTa-large 在 FigQA 上把 Llama-3 拉开 32 点,更像解码器零样本不会做修辞理解,不像编码器突然具备了 70B 级能力。2024 年的基线放到现在也过时了,数字只能当「小编码器这条路走得通」的证据,不能当排行榜。