RAG 应用砍到两次模型调用后,首 token 延迟依然偏慢
Bulky_Ring_244 · reddit · 2026-09-30
作者开源了一个「对话式个人档案」应用(回答关于某人公开工作成果的问题),最大的难点不是让 LLM 生成可信答案,而是阻止「看似合理但无依据」的细节变成自传式编造。
架构演进:早期设计有路由、证据选择、充分性检查、网页搜索、生成等多个阶段,请求路径越来越难推理;最终精简为两次托管模型调用:
- 分类消息,并在需要证据时改写为独立检索 query;
- 基于本地 Tantivy 索引返回的至多 5 份文档生成回答。
没有 agent 循环、没有运行时网页搜索、没有独立 LLM 评审;检索无结果时直接拒答而非即兴发挥;对话历史与可信知识索引分离,访客消息永远不会成为传记证据。
遗留问题:串行两次调用导致首 token 延迟偏高——流式输出必须等分类调用完成。作者在考虑:用更小更快的模型做分类、明显寒暄走非 LLM 快速路径、压缩分类 prompt、或把路由与生成合并(但会削弱检索与 grounding 控制)。同时语料策展与检索质量承担了更多责任,作者认为好过再加一个自己也可能出错的模型评审。项目 Apache-2.0 开源,含在线 demo。
「编程与Agent」频道最新
- 月付 420 美元 triple 订阅:一套能 ship 任何东西的编码模型组合 — iannuttall · 2026-09-30
- 测试长聊天 UI 的隐藏 bug:向上滚动加载图片时阅读位置易丢失 — gethackteam · 2026-09-30
- Cloudflare 创新周连发:容器启动快 6 倍、AI 网关自动选最省模型 — ritakozlov · 2026-09-30
- 陈天奇团队推出开源教材:用编译器驱动 Agent 自动优化 GPU 算子 — sh_reya · 2026-09-30
- computesdk 换新运行时:容器冷启动中位数从 4.05 秒降到 648 毫秒 — dinasaur_404 · 2026-09-30
- Golem 用 Jev 分类器搭日志事件管线,无数据库靠内存状态抗崩溃 — blaizedsouza · 2026-09-30