开发者上线 Lorivo:一张 GPU 共享服务上百个 LoRA 适配器

TheOneWhoWil · reddit · 2026-09-13

Reddit 用户发布了 Lorivo,一个基于 vLLM 的 LoRA 适配器 serverless 托管平台,解决微调模型后「要么本地 24/7 挂 GPU、要么租整台 GPU 服务器」的痛点。核心思路:base model 与 rank 8–32 的 LoRA 权重 99% 以上相同,没必要每个适配器单独开服务器。

工作流程:

还提供 CLI,lorivo login api-key + lorivo deploy ./my-lora 即可部署。目前作者自费用自己的 GPU 承载流量,现仅提供 Qwen 3.5 4B(永久免费,32k 上下文,qwen3-4b 可用 base 模型);手上有约 1000 美元 AWS 额度,正在征集社区最想加的模型。隐私上不保存对话与请求,仅记录 token 数与时间戳。作者征求架构与选题反馈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →