新论文:三指标路由器让 16GB 消费级 GPU 长上下文 RAG 零 OOM
chaumian · x · 2026-09-18
arXiv 论文提出 Tri-Metric Router,解决 RAG 在 NVIDIA T4(16GB VRAM)等消费级 GPU 上的「压缩悖论」:神经提示压缩会引入 KV cache 争用与预处理延迟、抵消生成时收益,而不压缩又会在长上下文下 OOM。
- 在 vLLM 服务模型与 PyTorch 压缩器共部署、内存紧张的场景下识别出两种失败机制
- 提出免训练的确定性策略,在 Raw、神经压缩(LLMLingua-2)、词法(BM25)三条管线间路由
- 依据三个 CPU 侧信号(空间复杂度 L、句法密度 ρkey、类符比 TTR)加硬件物理信号(VRAM 余量与延迟交叉点)决策,与以往纯语义自适应不同
- 阈值用 LongBench qasper 分析校准,T4 上交叉点约 4,332 词;分布外测试实现 0% OOM,达到 88.5±4.4% oracle 路由准确率
所属事件:Walmart 论文提出三指标路由器,让消费级 GPU 上 RAG 零 OOM(2 条相关)→
「Infra」频道最新
- ChatGPT 桌面版默认把文件与代码片段上传云端,教程教换 Ollama 本地运行 — Technovangelist · 2026-09-18
- vLLM 补丁实测:DiffusionGemma 与商业 API 打平且更快落败 — bodonoghue85 · 2026-09-18
- Modular 26.6 发布:Mojo 编译器开放外部贡献,MAX 支持音频生成 — clattner_llvm · 2026-09-18
- 小米 MiMo 实现流式大规模 LLM 强化学习训练,含 1T 参数模型 — stanfordnlp · 2026-09-18
- Gemini 托管 Agent 升级:成本降 30%,新增 Files 与 Credentials API — _philschmid · 2026-09-18
- 曝 OpenAI 顶级研究员每人每天烧 7000-8000 美元 Codex 算力 — venturetwins · 2026-09-18