四个小模型合并进一台推理服务器,doc-QA agent 运维负担大减

Sad-Razzmatazz-7657 · reddit · 2026-09-08

一位开发者分享其文档问答 agent 的架构演进:最终回答前要跑四个小模型——bge-m3 做查询向量、cross-encoder 重排、GLiNER 抽取字段、小 Qwen 起草常规部分。原本四个模型四个容器独立部署,上月重排器两次 OOM,且四套部署的维护占用了他大部分时间。

他用 Superlinked 的推理引擎(SIE)把它们合并到一台服务器,关键发现:

代价也很实在:LRU 驻留策略下 24GB 卡只能保 2-3 个模型热载,其余命中时重载;官方建议延迟敏感模型用独立池。他的流量是突发型所以共享没问题,前沿 LLM 仍留在外部。他最后的疑虑是爆炸半径:四个服务挂一个只死一个模型,一台服务器出事可能带崩整条管线,发帖询问有没有人做过类似合并、运维负担是真降了还是只是集中了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →