186M 查询-文档对、594 数据集、46 语言训练,评测集数据全部剔除

antoine_chaffin · x · 2026-10-08

作者公布训练细节:模型在来自 594 个数据集、46 种语言的 1.86 亿查询-文档对上训练,混合 text-to-text、text-to-image 和 text-to-visual-document 三种任务。训练前剔除了所有与评测基准相关的数据集——虽然牺牲了一些好数据,但换来可信的评测数字。

所属事件:0.6B 检索模型登顶 Q2D-Web,训练细节曝光(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →