RAG 延迟从90秒降到4秒
ezzeddinabdallah · reddit · 2026-07-18
作者分享了一个 RAG 管线优化案例:原本每次查询要 90 秒,用户经常还没等到答案就离开了。
他发现问题不在模型,而在检索层本身:
- embedding 过重
- 没有缓存
- 随着文档集增大,重复调用不断叠加
把这层重构后:
- 响应时间从 90 秒降到约 4 秒
- 成本大约下降 95%
- 另用 Weaviate 重建检索,主要解决的是“检索内容不准”的准确性问题
作者的结论是:很多 AI 性能问题,真正的瓶颈往往不是模型,而是没人注意的基础设施层。
「Infra」频道最新
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11
- p99 延迟基准可能在骗你:一篇长文讲透 coordinated omission — Franc0Fernand0 · 2026-09-11
- 12GB 显卡跑 MiniMax H3:量化格式、加速 LoRA 与注意力方案怎么选 — Possible_Mood676 · 2026-09-11
- Spomin:在 KV cache 里实时压缩上下文,500k 源 token 压进 180k 驻留 — wgaca2 · 2026-09-11