CrossBERT 让冻结表示更强,训练还快了约两倍

burkov · x · 2026-07-26

来自 Meta 和 NYU 的研究指出,传统 BERT 风格文本编码器通常是在微调后才被评估,这会掩盖一个问题:预训练本身到底学到了多少可复用表示。

他们采用“冻结编码器、只在输出上训练小模型”的方式来测试表示质量,结果发现:随着模型变大,标准 BERT 的可直接复用表示反而可能变差,尽管它在 masked-word 预测上更强。

为此,论文提出 CrossBERT:

实验显示,CrossBERT 的冻结表示会随着规模增大而稳定提升,而标准 BERT 往往下降;同时训练速度大约快 1.5–2 倍,数据利用效率也更好。

所属事件:Meta与NYU研究指BERT缩放缺陷并推出CrossBERT(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →