RAG 延迟从90秒降到4秒

ezzeddinabdallah · reddit · 2026-07-18

作者分享了一个 RAG 管线优化案例:原本每次查询要 90 秒,用户经常还没等到答案就离开了。

他发现问题不在模型,而在检索层本身:

把这层重构后:

作者的结论是:很多 AI 性能问题,真正的瓶颈往往不是模型,而是没人注意的基础设施层。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →