MoE 具身视频流的实时优化细节

omarsar0 · x · 2026-07-11

回复补充了系统与结构细节:为了实现实时,采用了双专家蒸馏、FP8 TensorRT、paged KV-cache 和运行时清理,把单块延迟从 927ms 降到 142ms,端到端最高达到 6.5 倍提升。结构上使用稀疏 MoE 视频流,包含 128 个专家、top-8 路由和一个共享专家,总参数约 13B、每 token 激活约 1.9B,从而兼顾复杂视觉动态和高频控制。

所属事件:LingBot-VA/VLA 2.0发布:原生具身基础模型与跨机身控制(24 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →