实验:仅用 1.2% 数据训练,微调表现逼近百万级
tomaarsen · x · 2026-08-26
作者在 RTX 3090 上进行扩展实验发现,仅用 10 万对数据和 75 分钟训练(占百万级数据的 10%),其 NDCG@10 分数仅比完整训练低 1.2 分,且大部分增益来自首小时。
对比实验还显示,Late Interaction 模型在作者数据上表现远超 Dense 模型,比参数量大 33 倍的 Qwen3-Embedding-4B 高出 13 分,而 Qwen3 的 8B 版本得分反而低于 4B。
所属事件:单卡3090微调ColBERT医疗检索模型,多向量方法击败通用基座(13 条相关)→
「研究」频道最新
- 陶哲轩:自动形式化尚昂贵耗时,但正在快速改善 — littmath · 2026-08-27
- 陶哲轩以身作则:用AI审查自己全部已发表论文找错 — littmath · 2026-08-27
- 陶哲轩:用AI产出更好的工作,而非更多PDF — littmath · 2026-08-27
- 中国前沿模型齐用线性注意力,Zai 推 MIT 开源 320B 多模态模型 — ivan_bezdomny · 2026-08-26
- 基于贝叶斯推断的 CI 故障诊断 Agent 设计与实现 — Elegant_Quantity_583 · 2026-08-26
- Nature 论文:规模化实验表征加速蛋白质设计 — DaveJuergens · 2026-08-26