四个小模型合并进一台推理服务器,doc-QA agent 运维负担大减
Sad-Razzmatazz-7657 · reddit · 2026-09-08
一位开发者分享其文档问答 agent 的架构演进:最终回答前要跑四个小模型——bge-m3 做查询向量、cross-encoder 重排、GLiNER 抽取字段、小 Qwen 起草常规部分。原本四个模型四个容器独立部署,上月重排器两次 OOM,且四套部署的维护占用了他大部分时间。
他用 Superlinked 的推理引擎(SIE)把它们合并到一台服务器,关键发现:
- bge-m3 一次 encode 可同时返回 dense 和 sparse 向量,原来两个“服务”本是一通调用
- Qwen 步骤通过 generate 调用跑在同一台服务器上
- 底层用共享队列按模型/操作分批,多模型共享 GPU 互不挤占
代价也很实在:LRU 驻留策略下 24GB 卡只能保 2-3 个模型热载,其余命中时重载;官方建议延迟敏感模型用独立池。他的流量是突发型所以共享没问题,前沿 LLM 仍留在外部。他最后的疑虑是爆炸半径:四个服务挂一个只死一个模型,一台服务器出事可能带崩整条管线,发帖询问有没有人做过类似合并、运维负担是真降了还是只是集中了。
「编程与Agent」频道最新
- 调试 Agent 工作流:trace 里看着健康的步骤,凭什么敢排除? — Sensitive-Parsnip-12 · 2026-09-08
- Notch 晒体素渲染器压测:一条渲染管线描述都不用写 — anselm · 2026-09-08
- Agent 犯错之后谁来兜底?生产团队呼吁「可回滚层」 — Anxious-Variation508 · 2026-09-08
- 智库高管吐槽:没见过高智商的人同时跑一堆随机 Agent — examachine · 2026-09-08
- Screen Studio 作者的 plan mode:两分钟口述加结构化复述 — johnlindquist · 2026-09-08
- Hajimete3D 推出图生 3D MCP 工作流:Agent 报价确认后才生成模型 — Shoddy-Technology950 · 2026-09-08