TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure
Yuhan Zhou, Yuchu Luo, Hao Nie, Wangrunze Lv, Yu Zhou, Yibo Zhu, Daxin Jiang, Chenren Xu
cs.DC
2026-08-06
北大与阶跃把权重、KV cache、checkpoint 的生命周期管理抽成统一层,性能追平各专项系统,组合路由把高并发 agent 负载的中位 TTFT 再降 93.2%。
LLM 推理系统里,张量早就不是算完就扔的中间产物。模型权重在弹性扩容时要从存储分发到新实例,KV cache 要跨节点复用,RL 后训练要把更新后的权重从训练侧同步给 rollout 侧。每一类任务都长出了专门系统:权重加载有 ServerlessLLM、InstantTensor,KV cache 有 Mooncake、LMCache,checkpoint 有 ByteCheckpoint。这些系统各自把张量的识别、放置、搬移、变换、物化这同一组操作,跟特定引擎、网络和存储后端焊死,形成一个个竖井。
竖井的代价有两层。同样的搬运机制换个 workload 就要重写一遍;更要命的是跨组件的策略没法表达,想让路由同时兼顾实例负载和 KV 局部性,得协调改路由器、KV 系统和执行引擎三处。
TensorCast 的主张是把这些操作抽成一个独立服务层,起名 Tensor-as-a-Service。系统约 16 万行 C++ 加约 9.5 万行 Python SDK,已开源,与 vLLM、SGLang 都有集成。
四个编程抽象构成接口:
运行时三类角色:worker(basic 出内存磁盘、gateway 接调用方、shard home 持分片)、instance 节点(引擎加 adaptor,是与 vLLM/SGLang 的机制边界)、Global Store(只存控制面元数据,DuckDB 后端,不在数据通路上)。元数据管理按张量类型分开:权重这类低基数张量集中在 Global Store;KV 页这类高基数张量按 HRW 哈希分片,top-3 候选 worker 竞争租约,租约带单调递增的 fencing token 防脑裂。数据面同机走 CUDA IPC 零拷贝,跨机有 RDMA 用 RDMA,没有就退到用户态 mTCP 多路传输。
硬件为 8×H800(权重加载)、双节点 4×H800(权重同步)、200 Gbps RDMA 集群(KV)和 4 节点 2×H20(路由)。
| 场景 | 对照 | 结果 |
| 权重加载,30B,JuiceFS,冷启动 | vLLM 原生 / InstantTensor | 快 60.7× / 10.2× |
| 端到端启动,235B,JuiceFS,热启动 | vLLM 原生 / InstantTensor | 快 228.6× / 40.7× |
| 权重同步(SGLang,无 RDMA) | 默认更新器 | 快 1.14×2.63× |
| KV 复用,32B,TP=2,RDMA | Mooncake | TTFT 降 60%87.5%,两者相当 |
| 可编程路由,256 会话 | load-aware+Mooncake | 中位 TTFT 降 93.2% |
228.6× 的前提要说清:热启动,权重已经在池里物化好,vLLM 经 CUDA IPC 不到 1 秒拿到张量,启动时间被运行时初始化支配。首次拉起对应的是冷启动档,30B 下是 60.7×。KV 场景无 RDMA 时反而明显超过 Mooncake,mTCP 多路聚合带宽是原因,跨机房没有 RDMA 的部署直接受益。路由实验用 OpenHands 在 SWE-Gym 约 2400 个真实 Python 仓库任务上的轨迹造多轮会话,快中慢三档负载下中位 TTFT 分别降 71.4%、93.2%、70.4%,缓存命中率随并发下滑的幅度也最小。
对推理平台工程师,这篇的价值不在单项提速,在于同一套张量搬运机制写一次、四个场景复用,而且每个单项都不掉速。权重加载、权重同步、KV 迁移、请求路由在今天多半是四套代码。跨组件策略的解锁更关键:负载与 KV 局部性联合优化的路由,在竖井式栈里要动引擎、KV 后端和调度器,在 TensorCast 里是一个几十行的 caller 程序,引擎一行不改。作者对定位也说得很直:不声称通用抽象天然快过所有专项实现,卖点是可组合且不掉速。
作者自述的:解耦消不掉引擎侧集成,每个引擎仍要写 instance adaptor;训练框架(Megatron-LM、DeepSpeed)集成留给未来;不做 ACID 意味着部分执行的计划留下残余状态。
读下来值得追问的:四组实验全在 Stepfun 与北大自家的测试环境,没有第三方复现;路由对照是 SGLang gateway 里的三种策略,没比最新的联合调度工作(引用的 DualMap 还在 under review);228.6× 依赖权重预物化,生产首次扩容落在冷启动档;权重加载的对照选了 InstantTensor,没纳入 ServerlessLLM 这类 serverless 冷启动专项系统。