InferCrane:自托管模型的生产级部署与回滚平台
yasintoy · reddit · 2026-08-28
InferCrane 是一个开源基础设施,用于在生产环境运维自托管、开源权重及自定义模型推理。它将部署、路由、扩缩容、监控和回滚等生命周期管理封装在一个稳定的 OpenAI 兼容端点后。系统支持 vLLM、SGLang 等运行时及 AWS/GCP/K8s 等提供商。核心功能 Release Guard 会在正式推广前评估版本,根据操作证据决定 promote、reject 或证据不足,确保只有安全版本才会上线,且操作具有持久性。
「Infra」频道最新
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28
- NVIDIA 推出 Mesh 开源计算网络,聚合闲置 GPU 跑 AI — nvidia · 2026-08-28
- AI 自动化研究发现 vLLM/SGLang 底层数值错误 — josh_tobin_ · 2026-08-28
- llama.cpp 定制分支:M1 Ultra 上 Metal 加速 Qwen3.8 推理 — tarruda · 2026-08-28
- Hot Chips 观察:推理芯片进入「群雄 ferment 时代」 — BenBajarin · 2026-08-28
- 实测 Muon 优化器:残差梯度平滑且稳定 — stochasticchasm · 2026-08-28