HybridInfer:本地模型优先推理,卡死自动回退云端的开源路由
simrankoulsm · reddit · 2026-09-02
开发者发布了开源(Apache-2.0)的可靠性感知推理路由 HybridInfer,解决本地跑模型时长 prompt 静默卡死、GPU OOM 导致请求挂起的问题:
- 每个请求先发给本地模型(Ollama);运行时监控若 N 秒无 token、OOM 或报错,在同一请求内自动回退到远端模型。
- 会学习哪些 prompt(通常是长 prompt)会让本机卡死,之后预先直接路由到云端。
- 把卡死的模型移出轮换,冷却后探测恢复。
实现为 OpenAI 兼容服务器,任何 OpenAI 兼容客户端接入即得「本地优先 + 自动回退」;远端可以是 OpenAI、OpenRouter 或 vLLM 等。它只做编排,不跑权重。另有 Kotlin/Android 版本供端侧应用使用。
安装使用:
pip install hybridinfer
hybridinfer init
hybridinfer serve
目前为早期 v0.1,作者征求日常跑本地模型的人对回退启发式的反馈。
所属事件:开源HybridInfer:本地模型卡顿自动切换云端(2 条相关)→
「编程与Agent」频道最新
- MCP 架构实践:Grok Bot 坐镇 Superhuman — bfrench · 2026-09-02
- Qwen3.8-Max 夺 CodeArena 冠军,定价新高 — Alibaba_Qwen · 2026-09-02
- Agent 工程的本质是约束工程 — burny_tech · 2026-09-02
- 模型越聪明越爱过思考?开发者吐槽代码生成变慢 — sandyyevans · 2026-09-02
- InternReviewer 用强化学习提升同行评审准确性 — Shanghai-AI-Laboratory · 2026-09-02
- 控制流与数据流分离,防止提示词优化毁掉多智能体管线 — UWaterloo · 2026-09-02