MixtureVitae证明许可数据集可消除与非许可数据集的差距

JJitsev · x · 2026-07-06

MixtureVitae 的核心研究问题不仅是能否构建许可语料库,而是能否让其与 DCLM 等强非许可基准的差距消失。答案是肯定的——关键在于放弃以网页文本为主的传统数据组成方式,大幅加入数学/代码/推理指令数据。

所属事件:MixtureVitae发布:网页文本仅占8%的开源数据集(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →