实验:仅用 1.2% 数据训练,微调表现逼近百万级

tomaarsen · x · 2026-08-26

作者在 RTX 3090 上进行扩展实验发现,仅用 10 万对数据和 75 分钟训练(占百万级数据的 10%),其 NDCG@10 分数仅比完整训练低 1.2 分,且大部分增益来自首小时。

对比实验还显示,Late Interaction 模型在作者数据上表现远超 Dense 模型,比参数量大 33 倍的 Qwen3-Embedding-4B 高出 13 分,而 Qwen3 的 8B 版本得分反而低于 4B。

所属事件:单卡3090微调ColBERT医疗检索模型,多向量方法击败通用基座(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →