轻量重排器训练仍有空间
tomaarsen · x · 2026-07-17
这篇博客补充了几个关键点:
- 训练只用了 213K 个训练组,且只跑了 single epoch;作者认为相比用数百万样本、或从更大 teacher 蒸馏的方法,仍然留有明显上限。
- 训练数据是 英文,但模型在 ViDoRe V3 上的法语表现并没有掉,反而在三个领域里甚至超过英文。
- 作者还坦诚列出了几项“没做成”的尝试:
- tournament scheduling 让指标下降 27 NDCG;
- first-token readout 的收益被限制在大约 1.6x;
- 把 listwise 模型按 pointwise 方式读入,会损失大部分提升;
- 对 2B 版本来说,最慢的不是解码,而是 ViT encoder。
所属事件:LightOn 推出多模态重排器系列(10 条相关)→
「研究」频道最新
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11
- 负向自蒸馏:让模型靠避开错误推理学会更好的推理 — Rongcan Pei · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- Yann LeCun 在 ECCV 直播开讲世界模型 — Weak_Assistance_5261 · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11