混合语料RAG新方案表现强劲
tomaarsen · x · 2026-07-17
这是一个面向混合语料 RAG 的强发布,重点适合处理 PDF、扫描页和纯文本 混在一起的场景。
帖中给出的关键信息包括:
- 面向团队做混合语料检索增强生成的工作流
- 训练规模为 213K training groups,且只训练了 single epoch
- 对比上,竞争者往往用了数百万样本,或依赖更大的教师模型蒸馏,因此这个配方仍有明显提升空间
- 训练数据是英文,但在 ViDoRe V3 上法语表现依然不错,且在三个领域里甚至超过英文
整体看,这更像是一个有实验支撑的 RAG 方案/研究结果,而不只是宣传。
所属事件:LightOn 推出多模态重排器系列(10 条相关)→
「研究」频道最新
- MaP-WAM 用记忆驱动规划攻克非马尔可夫机器人操作难题 — Sizhe Zhao · 2026-09-11
- 负向自蒸馏:让模型靠避开错误推理学会更好的推理 — Rongcan Pei · 2026-09-11
- NBER 经济学论文约 24% 含 AI 生成文本,2025 年起激增 — JeremyNguyenPhD · 2026-09-11
- 分析:24% 的 NBER 经济学论文含有 AI 生成文本痕迹 — JeremyNguyenPhD · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11