Orthrus 系统统一嵌入与生成推理,迭代 RAG 吞吐最高提升 4.52 倍
_reachsumit · x · 2026-09-23
EMNLP 2026 主会论文《Efficient Iterative Retrieval with Heterogeneous Batching》,代码已开源。
- 问题:迭代式 RAG 同时用嵌入模型和生成模型,现有服务系统将其分置不同 GPU,粗粒度切分无法适应动态负载,产生大量计算“气泡”,GPU 利用率低。
- 方法:Orthrus 在统一推理循环内做异构批处理,通过分块嵌入加增量池化、以及按负载感知调整批组成,调和两种冲突的计算模式。
- 结果:在 4 块 A100 上,受控工作负载吞吐较基线提升 1.28×-4.52×,迭代 RAG 基准的端到端 p99 延迟最多降低 55.8%。
「Infra」频道最新
- 开源自托管备份方案Pluton:Restic+Rclone加密备份跨云复制 — tom_doerr · 2026-09-23
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23
- AWS 开源 Strands harness:同一模型 agent 包裹层省 28% token — shashib · 2026-09-23
- 机箱风道调优实战:多 GPU 从 80°C 压到 68°C 无需水冷 — HankYeomans · 2026-09-23
- 阿里加速全球 AI 布局,将在欧洲与中东新建数据中心 — Polymarket · 2026-09-23
- 决定推理性能的是 Kernel 而非模型:同一模型同卡表现可天差地别 — Roger_M_Taylor · 2026-09-23