NVIDIA 发布 UNREAL:一个模型统一语料检索与 128K 长上下文
nvidia · hf · 2026-10-07
- 核心思路:用冻结 LLM 的内部表示同时完成语料级检索与长上下文证据选择,新增可训练参数不到 50 万,主干模型不动。
- 检索性能:在 3B token、2100 万 chunk 的 Wikipedia 索引上,UNREAL 全面超过 SOTA retriever-reranker,HotpotQA 召回率从 49.1% 升至 73.2%,2WikiMultiHopQA 从 31.7% 升至 60.1%,MuSiQue 从 8.8% 升至 14.4%。
- 长上下文:同一机制在生成前剔除干扰证据,NoLiMa 在 128K 最大上下文下准确率从 1.0% 提到 24.83%,LV-Eval F1 在 256K 下从 49.97% 提到 54.66%。
- 效率:从约 32K token 起,FLOPs 与首 token 延迟低于全上下文推理,上下文越长收益越大。
所属事件:NVIDIA 发布 UNREAL:一个模型统一检索与长上下文(2 条相关)→
「Infra」频道最新
- 为什么 2019 款 Mac Pro 才是本地 LLM 的理想机器 — Odd-Capital-847 · 2026-10-07
- RL 训练团队爆料:1T 全量权重同步低于 5 秒 — saurabh_shah2 · 2026-10-07
- SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍 — Gunho Park · 2026-10-07
- Ora 扫描 10 万+网站:仅 5% 对 AI Agent 友好,平均分 41 — EdenEmarco177 · 2026-10-07
- 重训 DFlash 2 草稿模型,27B 三值模型 L4 提速 2.2 倍 — naklitechie · 2026-10-07
- 独立开发者吐槽 Together AI 限流:多 Agent 并行测试寸步难行 — Correct_Positive_108 · 2026-10-07