开发者上线 Lorivo:一张 GPU 共享服务上百个 LoRA 适配器
TheOneWhoWil · reddit · 2026-09-13
Reddit 用户发布了 Lorivo,一个基于 vLLM 的 LoRA 适配器 serverless 托管平台,解决微调模型后「要么本地 24/7 挂 GPU、要么租整台 GPU 服务器」的痛点。核心思路:base model 与 rank 8–32 的 LoRA 权重 99% 以上相同,没必要每个适配器单独开服务器。
工作流程:
- 上传 LoRA 适配器
- 平台识别 base model 并路由到运行该模型的 GPU 服务器
- 适配器载入内存,利用 vLLM 已有的 batching、显存管理与 fused LoRA kernels
- 直接获得 OpenAI 兼容的推理端点
还提供 CLI,lorivo login api-key + lorivo deploy ./my-lora 即可部署。目前作者自费用自己的 GPU 承载流量,现仅提供 Qwen 3.5 4B(永久免费,32k 上下文,qwen3-4b 可用 base 模型);手上有约 1000 美元 AWS 额度,正在征集社区最想加的模型。隐私上不保存对话与请求,仅记录 token 数与时间戳。作者征求架构与选题反馈。
「Infra」频道最新
- DeepMind 首席策略师:巨额 AI 基建投的是递归自我改进的赌注 — rohanpaul_ai · 2026-09-13
- AI 估值互相矛盾:内存股 3-5 倍 PE,Nvidia 便宜得可疑 — rohanpaul_ai · 2026-09-13
- Draw Things 推出 Local Code 公测:Mac 本地跑编程 agent,prefill 快 1.2-1.6 倍 — liuliu · 2026-09-13
- Macrocosmos 推出 IOTA:把分散闲置算力聚合成训练能力 — markjeffrey · 2026-09-13
- 日本 neocloud「ai&」宣称 CUDA 护城河已消失,大举部署 Tenstorrent 芯片 — DavidBennett__ · 2026-09-13
- 魔改 vLLM 补丁把 Gemma 4 31B 推理提速至 150 tok/s,超越 SGLang 最佳成绩 — abhijithneil · 2026-09-13