开源HybridInfer:本地模型卡顿自动切换云端

开发者开源了 Apache-2.0 协议的可靠性感知推理路由 HybridInfer,解决本地跑大模型时长 prompt 静默卡死、GPU 显存溢出导致请求挂起的问题。它优先将请求发送至本地模型(如 Ollama),实时监控运行状态,一旦检测到卡顿或故障即自动切换到云端推理,兼顾成本与高可用性。

2026-09-02 ~ 2026-09-02 · 2 条相关