kalomaze:标签不对称时,模型学到多少取决于必须建模多少条件信息
kalomaze · x · 2026-09-21
kalomaze 提出一个关于表示学习的观察:当数据中存在「标签 vs 条件信息」的极端不对称时,模型对条件信息(conditioning)的学习程度,取决于「把标签预测好」这件事在多大程度上迫使模型去建模条件本身。他举的极端例子是对人类语音做 BCE 二分类的性别识别。在回复中他补充对比:语言建模天然没有这种不对称——NTP(下一词预测)对所有 token 都能免费获得自监督信号;并调侃两位同行的算力差距(一个用 NVL72,一个用 4090 加一腔热血),暗示条件信息不足时可以靠想法弥补。
所属事件:开发者称多模态训练难以绕开自监督主干特征(4 条相关)→
「研究」频道最新
- 25 位菲尔兹奖得主发宣言,7400 名研究者声援反对 AI 刷数学题 — AryHHAry · 2026-09-21
- DeepMind 研究员长文:AI 时代数学研究的意义与人类数学家角色 — AndrewLampinen · 2026-09-21
- Typesafe 新模型 Jev 遇上图模型:不确定性推理的范式转变? — fdellaert · 2026-09-21
- LLM 时代灌水论文泛滥,arXiv 插旗文化积弊十年再引热议 — RexDouglass · 2026-09-21
- Meta 研究员提议:允许审稿人给「浪费所有人时间」打分 — burny_tech · 2026-09-21
- 从 Jev 悖论到苦涩的教训:不同规模的模型各有用武之地? — amankhan · 2026-09-21