两条实战经验:多模态训练绕不开 SSL 主干特征

kalomaze · x · 2026-09-21

kalomaze 分享了一个观点转变:他原本认为多模态模型直接从纯数据端到端学习即可,借用 SSL(自监督学习)预训练的主干特征显得偷懒;但在看到两位同行在多模态上撞墙、最终都采用 SSL 主干后,他改变了看法。他解释了语言模型为何不同:得益于下一个 token 预测(NTP)目标,语言任务天然免费获得 SSL 信号,因为不存在「这些 token 只是条件输入」的不对称性,而多模态输入则缺乏这种对称性,导致纯端到端方案难以学出足够好的表征。

所属事件:开发者称多模态训练难以绕开自监督主干特征(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →