BEFT:只微调0.01%参数,Value偏置让低数据微调更高效
量子位 · wechat · 2026-08-12
瑞典隆德大学与Google DeepMind的研究团队提出BEFT(Bias-Efficient Fine-Tuning)方法,系统比较了Transformer注意力中Query、Key、Value三类偏置项的可训练性。核心结论是:在低数据场景下,直接微调Value投影的偏置b(v)通常优于微调b(q)或b(k),且可训练参数极少。
技术原理:
- b(k)因softmax平移不变性几乎无效;b(q)影响易被softmax压缩;b(v)等价于在注意力输出后增加线性自由度,最有效。
- 论文提出结合模长与夹角变化的偏置重要性排序方法,比传统Magnitude和Fisher信息更准确。
实验结果:
- 在BERT(BASE)的GLUE任务上,低数据时b(v)平均得分64.5%,远高于b(q)的57.8%和b(k)的53.5%。
- 在RTE低数据实验中,BEFT仅训练0.01%参数,准确率58.53%,优于全偏置微调(0.09%参数,56.40%)和全参数微调(100%参数,57.46%),训练时间也最短。
- 在RoBERTa、BERT(LARGE)、OPT-1.3B/6.7B等模型上验证,对无偏置模型(如LLaMA2-7B)手动添加b(v)也有效。
- 与LoRA等PEFT方法组合时,b(v)仍优于其他偏置。
该工作已被ACL 2026主会接收,并集成进HuggingFace PEFT库。
「研究」频道最新
- 研究者提议:用 RL 教 AI 学会在恰当时机放弃 — sqcai · 2026-09-22
- Dinur 凭 2006 年 PCP 定理新证摘得哥德尔奖,两节课即可讲完 — willcb · 2026-09-22
- Nature 发表 Delphy:近实时贝叶斯系统发育学追踪疫情爆发 — burny_tech · 2026-09-22
- Google 杰出科学家 Milanfar 将在 UCSB 讲 AI 计算成像未来 — docmilanfar · 2026-09-22
- FLA 库 KDA fast path 被曝前缀输出泄漏未来门控,下版修复 — YouJiacheng · 2026-09-22
- Halvar Flake 演讲:计算机科学正从精确学科变成概率学科 — soumitrashukla9 · 2026-09-22