为 Nemotron 注入希腊语能力:端到端 RAG 适配与基准测试

KIEFERSA · hf · 2026-08-07

由于主流多语言检索模型中缺乏现代希腊语的支持,作者对 NVIDIA 的 Nemotron 检索栈进行了端到端的适配,涵盖了语料挖掘、合成监督、模型训练和阅读器微调。

研究发现,在专业领域的希腊语文本上,无参数的 BM25 基线竟然优于许多现成的多语言密集检索模型。但在使用 65,773 对希腊语检索数据进行微调后,Nemotron 1B 嵌入模型的 nDCG@10 指标从 0.362 跃升至 0.835。

此外,作者还对 Nemotron 30B-A3B MoE 阅读器进行了 LoRA 微调,以实现基于检索的生成,将答案正确率从 29.4% 提升至 66.9%,同时显著增强了忠实度和引用质量。论文还发布了首个大规模希腊语 RAG 基准测试 HERA。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →