RAG 应用砍到两次模型调用后,首 token 延迟依然偏慢

Bulky_Ring_244 · reddit · 2026-09-30

作者开源了一个「对话式个人档案」应用(回答关于某人公开工作成果的问题),最大的难点不是让 LLM 生成可信答案,而是阻止「看似合理但无依据」的细节变成自传式编造。

架构演进:早期设计有路由、证据选择、充分性检查、网页搜索、生成等多个阶段,请求路径越来越难推理;最终精简为两次托管模型调用:

没有 agent 循环、没有运行时网页搜索、没有独立 LLM 评审;检索无结果时直接拒答而非即兴发挥;对话历史与可信知识索引分离,访客消息永远不会成为传记证据。

遗留问题:串行两次调用导致首 token 延迟偏高——流式输出必须等分类调用完成。作者在考虑:用更小更快的模型做分类、明显寒暄走非 LLM 快速路径、压缩分类 prompt、或把路由与生成合并(但会削弱检索与 grounding 控制)。同时语料策展与检索质量承担了更多责任,作者认为好过再加一个自己也可能出错的模型评审。项目 Apache-2.0 开源,含在线 demo。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →