CrossBERT 让冻结表示更强,训练还快了约两倍
burkov · x · 2026-07-26
来自 Meta 和 NYU 的研究指出,传统 BERT 风格文本编码器通常是在微调后才被评估,这会掩盖一个问题:预训练本身到底学到了多少可复用表示。
他们采用“冻结编码器、只在输出上训练小模型”的方式来测试表示质量,结果发现:随着模型变大,标准 BERT 的可直接复用表示反而可能变差,尽管它在 masked-word 预测上更强。
为此,论文提出 CrossBERT:
- 主编码器专注生成表示;
- 一个更小的预测器负责根据表示重建缺失词。
实验显示,CrossBERT 的冻结表示会随着规模增大而稳定提升,而标准 BERT 往往下降;同时训练速度大约快 1.5–2 倍,数据利用效率也更好。
所属事件:Meta与NYU研究指BERT缩放缺陷并推出CrossBERT(2 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11