NVIDIA UNREAL 论文:让 LLM 自主检索,30 亿 token 语料召回率大涨
mark_k · x · 2026-10-08
传统 RAG 通常用一个独立检索模型找文档,再交给 LLM 回答。NVIDIA 的 UNREAL 论文提出让同一个 LLM 兼职做检索:利用模型自身的内部表示来从索引中筛选所需信息,只新增不到 50 万可训练参数,基座模型保持冻结。
效果数据:
- 在 30 亿 token 的 Wikipedia 索引上,HotpotQA 的完整证据召回率从 49.1% 提升到 73.2%,2WikiMultiHopQA 从 31.7% 提升到 60.1%。
- 同一机制还能过滤长提示词中的干扰信息:NoLiMa 在 128K token 长度下的准确率从 1% 提升到 24.83%。
- 从约 32K token 起还能降低计算量,缩短首 token 等待时间。
一个模型同时完成找证据和答题,可能让知识密集型 AI 系统的架构大幅简化。
所属事件:NVIDIA UNREAL:一个模型统一检索与 128K 长上下文(3 条相关)→
「Infra」频道最新
- 企业 AI 走向模型路由:最小够用模型比最强模型更划算 — ingliguori · 2026-10-08
- 众测本地编码 Harness:3090 凭 qwen3.8-flash-next 配置击败 5090 — dh7net · 2026-10-08
- llama.cpp 支持异构设备分布式推理,GPU+笔记本跑满 40 tokens/s — joao_gante · 2026-10-08
- Java 推理框架 jitLLM 宣称达 llama.cpp 90% GPU 性能 — mikebmx1 · 2026-10-08
- 台湾封测厂 9 个月下单 110 亿美元设备,超 2019-2025 总和 — zephyr_z9 · 2026-10-08
- NVIDIA 官宣 GTC 柏林:黄仁勋 10 月 21 日发表主题演讲 — GavinSBaker · 2026-10-08