单卡50万token/秒:小模型服务栈的工程解法
AI Engineer · youtube · 2026-09-20
Superlinked 的 Daniel Svonava 在 AI Engineer 的演讲,主题是小模型的服务基础设施。
核心判断
- 嵌入(embeddings)是「无脑入门点」:一块中端 GPU 就能把每秒 50 万 token 转成嵌入,延迟只有几十毫秒;而托管端点贵几个数量级、慢几百毫秒。
- 小模型正在追上甚至超越前沿:一个两三代前的小模型能塞进单卡,针对特定任务已达或超过前沿水平——前沿在变平,小开源模型在爬升。
- 不要用一个 270 亿参数模型干所有事:把负载切成任务,每个任务选对应训练的模型,一个合同审查 agent 最终会跑九个模型。见过最多越南收据的模型就赢下越南收据 OCR。
三个卡点
- 开源服务工具出厂未调优,采用一个就等于开一个研究项目。
- 自上而下的路由器是为「把一个大模型摊到多卡」设计的,面对大量小请求会卡住,因为它对 worker 状态的认知总是过时,利用率停在 30% 左右。
- LoRA 和隔夜微调让每次部署都变成 AI 工程师与基础设施工程师的对话,拖垮迭代速度。
Superlinked 的做法
- 从控制面到 GPU 全部 Apache 2.0 开源。
- 网关不做完整解析,只给请求打标注后丢进共享队列,worker 自己拉取并自行组批——这个反转让集群吞吐翻倍。
- Rust sidecar 在三种运行时之上抽象出 50 个适配器;autoresearch 循环让每个模型出厂即调优。
- 一个成果是:花 80 美分的 LoRA,把德语法律文本的检索效果提升 18%。
「Infra」频道最新
- 回顾游戏引擎与推理引擎:本质都是多用户批处理系统 — yunta_tsai · 2026-09-20
- vLLM 接入 speculative decoding 教程:生成速度可翻倍 — MaiaStudios · 2026-09-20
- Charles Frye:KV 压缩失败罕见但代价高,长上下文场景难跑分 — charles_irl · 2026-09-20
- 千分之一概率乱码:vLLM 两个 Mamba 缓存 bug 的排查实录 — AI Engineer · 2026-09-20
- 分析师称企业多付 10-20 倍云 AI 成本,本地化拐点将至 — DavidLinthicum · 2026-09-20
- 一觉醒来欠 3.6 万美元:Cloudflare 无硬性消费上限的避坑指南 — ThePeterMick · 2026-09-20