NVIDIA 发布 Nemotron-3-Embed 系列
NVIDIA 发布了 Nemotron-3-Embed 系列多语言 embedding 模型,定位于 agentic retrieval、代码检索和 agent memory,并强调模型权重开放且可商用。这次发布值得关注,一是因为 NVIDIA 把检索质量直接与智能体最终回答质量挂钩,二是其 8B 版本被官方宣称在 RTEB 上拿到 overall #1。
发布内容
据 NVIDIA 及相关帖子,这一系列包含两款 BF16 模型:Nemotron-3-Embed-1B-BF16 和 Nemotron-3-Embed-8B-BF16,面向 sentence similarity 与 text embeddings 等多语言检索场景。@tomaarsen 还提到,该系列已原生集成进 Sentence Transformers,可直接加载 nvidia/Nemotron-3-Embed-8B-BF16 来分别编码 query 和 document。
基准成绩与产品定位
NVIDIA 表示,Nemotron-3-Embed-8B-BF16 在 RTEB 上获得整体第一;官方将 RTEB 解释为衡量现实任务检索准确率的基准。@kimmonismus 转发时补充了成绩数字:RTEB 平均 NDCG@10 为 78.46,MMTEB Retrieval 为 75.45。官方的核心论点是,更好的检索会给 agent 提供更相关的上下文,从而提升最终回答准确率;围绕发布的帖子也将其描述为适合成本敏感型 agentic retrieval 的方案。7 月 18 日,@nvidia 又补充称 8B-BF16 已进入 Hugging Face Trending。
压缩与部署线索
除了 8B 的榜单成绩,@tomaarsen 还特别指出 1B 模型采用了一条相对少见的压缩路线:先从 3B 父模型通过 NVIDIA ModelOpt 做 NAS 剪枝到 2B,再使用 8B 教师模型,以 cosine loss 和 MSE loss 进行蒸馏。另据 @soumitrashukla9 的转发解读,他尤其关注 1B 的 NVFP4 版本,认为按帖子给出的描述,即便把 KV 和 CUDA 开销算在内,在不少场景下其体积仍有望控制在较可用的范围内。
2026-07-17 ~ 2026-07-18 · 11 条相关
一手来源
- NVIDIA 发布新 embedding 模型并登顶 RTEB — NVIDIAAI ·
- Nemotron 3 Embed 8B 登顶 RTEB — NVIDIAAI ·
- NVIDIA 推出 Nemotron-3 嵌入模型 — nvidia ·
- NVIDIA发布Nemotron 3 Embed 8B — NVIDIAAI · 2026-07-17
- NVIDIA 发布 Nemotron-3-Embed — tomaarsen · 2026-07-17
- NVIDIA 发布新嵌入模型并大幅提分 — tomaarsen · 2026-07-17
- NVIDIA 发布多语嵌入模型 — tomaarsen · 2026-07-17
- NVIDIA放出高性能Embedding模型 — soumitrashukla9 · 2026-07-17
- NVIDIA 推出 Nemotron-3-Embed 系列 — rohanpaul_ai · 2026-07-17
- 新 Embedding 模型登顶多语 RTEB — jeremyjordan · 2026-07-17
- NVIDIA 发布新检索嵌入模型 — kimmonismus · 2026-07-17
- 【源头】NVIDIA 推出 Nemotron-3 嵌入模型 — nvidia · 2026-07-18