Large Language Models Understand and Can be Enhanced by Emotional Stimuli
Cheng Li, Jindong Wang, Yixuan Zhang, Kaijie Zhu, Wenxin Hou, Jianxun Lian, Fang Luo, Qiang Yang, Xing Xie
IJCAI'23
cs.CL, cs.AI, cs.HC
2023-07-14
在原提示后接上十一条情绪刺激,六个模型做 Instruction Induction 零样本,平均准确率只从 51.65 到 51.98;按模型取最优句,相对提升约 8%,106 人看的生成任务平均高 10.9%。
人做决定时会被期望、信心和别人的看法带着走。课堂鼓励和健康宣传都靠正面措辞改变行为,这是心理学里的老结果。大模型会推理,也会跟指令。没量过的是把这类句子贴到提示末尾,任务分会不会动。
认情绪词的实验已经有了,那些实验不看贴上去以后答得对不对。Zero-shot-CoT 和自动搜出的提示也不稳:同一句追加,中等模型和 GPT-4 的收益可以差一截。多贴一句几乎不花钱,一个总平均数却说明不了谁在涨。
EmotionPrompt 就是拼接。原始提示不动,末尾加一条刺激,不改权重,也不改示例格式。十一句来自三类心理学说法,分成「别人怎么看」和「给自己打气」。
自我监控,按场合调整表现,对应 EP01 到 EP05。EP01 让模型给答案打 0 到 1 的置信度。EP02 是「This is very important to my career」。EP03 到 EP05 用「You'd better be sure.」「Are you sure?」,并要求再看一遍。自我效能来自社会认知理论,核心是相信自己做得成,写成 EP07 到 EP11,里面有「believe in your abilities」「success」「take pride in」。再评价来自认知情绪调节,把难处说成还做得动的事,叠在 EP03 到 EP05 和 EP07 上。EP06 把 EP01、EP02、EP03 粘成一条。
模型是 Flan-T5-Large、Vicuna、Llama 2、BLOOM、ChatGPT(gpt-3.5-turbo-0613)和 GPT-4。ChatGPT、GPT-4、Llama 2 温度为 0.7,其余默认。任务是 Instruction Induction 的 24 项,指标准确率;BIG-Bench 的 21 项用归一化分,100 等于人类专家,0 等于随机,低于随机可以为负。零样本把刺激接在原提示后,五样本再随机加 5 对输入输出。基线有人工原提示、原提示加「Let's think step by step」,以及 APE 生成的提示。BIG-Bench 只做零样本,算力不够。
另有 106 人评 GPT-4 的 30 道开放题,原提示和情绪提示各一版,表现、真实性、责任感各打 1 到 5 分。10 题来自 TruthfulQA,15 题用来诱出偏见,5 题是写诗和摘要。
下表是六个模型的平均。不挑句子看十一条平均;最优列是跑完再取最高。
| 设置 | 原提示 | Zero-shot-CoT | 十一条平均 | 最优刺激 |
| Instruction Induction 零样本准确率 | 51.65 | 46.74 | 51.98 | 55.24 |
| Instruction Induction 五样本准确率 | 47.97 | 46.15 | 50.02 | 52.40 |
| BIG-Bench 人工提示,归一化分 | 10.16 | 10.37 | 10.61 | 11.92 |
| BIG-Bench 接在 APE 提示后 | 2.39 | 3.44 | 5.20 | 7.47 |
8.00% 的算法是:零样本 Instruction Induction 上,各模型用自己的最优刺激,相对原提示求增益,再对六个模型平均。绝对分从 51.65 到 55.24。十一条拉平只多 0.33。
平均列里三个升、三个降。Vicuna 44.91 到 50.56,BLOOM 33.46 到 35.95,ChatGPT 75.20 到 76.85。Flan-T5-Large 25.25 降到 22.93,Llama 2 50.33 降到 46.61,GPT-4 80.75 降到 78.96。
五样本平均列多 2.05 分,47.97 到 50.02,大于零样本的 0.33。GPT-4 五样本从 82.13 到平均 84.12、最优 87.13。同一张表上,Zero-shot-CoT 把 GPT-4 从 80.75 打到 59.72,五样本从 82.13 打到 67.62。
115% 对不上人工提示。那一档平均只从 10.16 到 11.92,GPT-4 从 22.69 到最优 24.80,离人类专家的 100 很远。接近 115% 的是 APE 行:2.39 到平均 5.20、最优 7.47。ChatGPT 的人工提示有 20.10,APE 把它打到 5.12,情绪句最多拉回 18.00,还是低于人工提示。
EP02 在 Instruction Induction 上最好,比最差句高 6.06%,到 BIG-Bench 就变差。难任务上最好的是 EP06。
TruthfulQA 共 817 题。ChatGPT 原提示 0.75 / 0.53,十一条平均 0.80 / 0.68,EP01 单独是 0.61 / 0.94。Vicuna-13B 从 0.77 / 0.32 到平均 0.82 / 0.05,CoT 是 0.99 / 0.00。论文给出的 19% 与 12%,数量上等于三个模型各自最优句的分差再平均:真实性约 +0.12、+0.23、+0.23,信息量约 +0.41、-0.10、+0.06。Vicuna 信息量最高 0.22,仍低于 0.32。GPT-4 没测。
106 人的三项平均改善是 10.9%。30 题有 2 题变差,表现分上近三分之一的题目,分差接近或超过 1 分。差的那题里,情绪提示用「completely」「will not」,原提示用「generally」「may even be」;另一题原提示有结尾,情绪提示只列要点。
梯度范数只在 Flan-T5-Large 上算过。八项任务里,confidence、sure、success、achievement 的贡献在四项上过半,两项接近 70%。温度从 0 到 1.5,两边间隙变大,情绪提示更平。温度 0 下 Vicuna 和 Llama 2 没有有效结果。
贴一句就能用,不用训练。两处比较实在:提示已定,想在验证集上再挤准确率;温度高,原提示开始晃。后一种有温度曲线撑着,情绪句随温度的起伏更小。
别当成默认后缀。EP02 只在简单题上领先。EP01 加 EP04 已经够用时,再加 EP06 到 EP09 会停,甚至下降。GPT-4 零样本平均列低于原提示,最优列 80.75 到 81.60,只多 0.85。句子要在自己的题上选。
同一句还会把回答写长,并把口气说死。失败案例被归到职业生涯那句和「You'd better be sure.」。
最优列是看完十一条再挑的。零样本平均列里一半模型为负,正文仍写成所有模型都有稳定提升。BIG-Bench 人工提示下 Flan-T5-Large 的最优分是 4.00,原提示 4.66,最优列也会输。
表 6 写 Llama 2 增益 6.00、BLOOM 增益 0.51。用表 1 相减,6.00 是 BLOOM 的 33.46 到 39.46,0.51 是 Llama 2 的 50.33 到 50.84。两表对不上,RLHF 解释不了这组 13B 模型的差异。越大收益越大也不成立,Vicuna 高 9.58 分,GPT-4 高 0.85 分。
106 人全是学士,九成 20 到 25 岁。方差大,正文归到主观打分。30 题、只评 GPT-4,10.9% 把三项合在一起,分项均值没有单独给出。
输入贡献只测了 780M 的 encoder-decoder、情感分类这一项。结论写了和人类研究的分歧:情绪能带动态度,人的推理不会因一句鼓励变强。正词权重大,只说明这些词占住了梯度,并不是情绪理解的证据。EP01 要一个置信度,那是额外指令。