Meta、NYU 和 Yann LeCun 认为 BERT 编码器会在扩展中失效
pbaylies · x · 2026-07-25
帖子转发的是一篇论文截图,核心结论是:传统 BERT 式双向编码器存在明显的缩放缺陷,预训练算力越大,冻结后用于下游任务的表征反而可能变差。
作者提出 CrossBERT:把“表征学习”和“token 重建”解耦成两部分架构。论文声称这带来三个收益:
- 可以使用更高的 masking ratio
- 通过对所有 token 收集梯度提升训练效率
- 在 MTBE(eng, v2)和冻结版 GLUE 基准上实现更稳定的单调缩放与更好表现
「研究」频道最新
- 贝叶斯视角认为 LLM 采样仍有空间,行业却忙了三年结构化生成 — remilouf · 2026-07-25
- AIMACS26 讨论结构化 LLM 输出与 Lean CSLib 教程 — swarat · 2026-07-25
- 论文称 LLM 具有人类拟态倾向,也会复现人类缺点 — dioscuri · 2026-07-25
- 蛋白质设计预印本压缩到 8192 个 ProtWords 并生成折叠蛋白 — CatAstro_Piyush · 2026-07-25
- AI 检测器准确区分 4 篇 AI 文和 2 篇真人文,作者自嘲只有机器能分辨 — paul_cal · 2026-07-25
- HartwigGroup 加入 Genesis Mission,做合成化学机器学习模型 — CatAstro_Piyush · 2026-07-25