NVIDIA 发布多语嵌入模型
tomaarsen · x · 2026-07-17
NVIDIA 这次发布了新的 embedding 方案,并且原生集成到 Sentence Transformers 中,使用时可以直接加载 nvidia/Nemotron-3-Embed-8B-BF16,对 query 和 document 分别编码。
帖子还提到它支持 NVFP4 变体和 vLLM,保存了 prompts 与归一化元数据,query/passage 前缀会自动处理。作者的评价是:这是一个面向多语种 RAG 的很强发布,检索准确率看起来领先,1B 版本则更适合预算有限的团队。
所属事件:NVIDIA 发布 Nemotron-3-Embed 系列(11 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11