Macaron-V1-Venti 上线即接入 vLLM 多 LoRA 路由
vllm_project · x · 2026-07-22
Macaron-V1-Venti 上线时就同时获得了 vLLM 和 SGLang 的 day-0 支持。
- 他们开源的 MoL Harness 会在一个兼容 OpenAI API 的单一端点后面,把每个请求路由给合适的 LoRA 专家。
- 这套方案建立在 vLLM 原生的 Multi-LoRA serving 能力上。
- 重点是把多专家路由、服务部署和开源实现结合起来,方便直接落地。
「Infra」频道最新
- OpenFPM 的 CUDA 风格内核已可在 Apple GPU 上通过 Metal 运行 — Scobleizer · 2026-07-22
- SkewAdam 将 MoE 优化器显存降 97.4%,6.78B 可放进 40GB GPU — Kooky-Ad-4124 · 2026-07-22
- 三星据称拟以 200 亿欧元估值投资 Mistral 10 亿欧元 — rohanpaul_ai · 2026-07-22
- NVIDIA 与 ETH Zurich 通过删 barrier 降低 AllReduce 延迟 — thoefler · 2026-07-22
- Grok Build 为开发者新增 token 统计与批处理诊断 — elonmusk · 2026-07-22
- Qwen3.8-Max-Preview 登顶 NVIDIA FlashInfer 推理榜 — Scobleizer · 2026-07-22