VDN-H3 移植到 Vpipe:M5 Pro 24GB 上 H3 生成最快提速 2.6 倍
TgoAI · reddit · 2026-09-07
作者将 VDN-H3(Video DeltaNet for MiniMax H3) 移植到 Vpipe——一个纯 C++20/Metal 的 Apple Silicon 原生推理运行时(不用 PyTorch/MPS/MLX),端到端只花约一天。
性能结果:
- 提速随序列长度与分辨率增长:832×480 下约 6 秒开始领先,15 秒达 1.7×;1344×768 下交叉点更早,约 14 秒达 2.6×
- 测试均用 6 DiT steps + Turbo LoRA
- 参照:FastH3 在 M4 Max 36GB 上同规格需 465–504 秒;Vpipe 的无 VDN 基线在 16GB M5 MacBook Air 上冷启动约 469 秒
原理与代价:
- VDN 的思路是利用视频扩散固有的冗余,而非对全序列均匀分配算力;采用帧级线性注意力 + softmax 注意力混合架构
- 内存代价:新增约 4GB 无法融合的权重 + 约 1GB 可 LoRA 式融合的权重(尚未实现),24GB 机器上小任务可能得不偿失;可量化到 8-bit 降低开销
质量观察: 同种子下构图与基线高度一致,但部分序列有长程时序不一致(如水流方向中途反转),疑似与滑窗/线性注意力有关,可考虑混入全局注意力。首尾帧/参考图 conditioning 是待探索方向。
「Infra」频道最新
- PyTorchCon China 明日上海开幕,华为专场谈跨加速器工作负载 — PyTorch · 2026-09-07
- 一场演讲塞四个互连标准,从业者自嘲「光互连就是个大烂摊子」 — jwt0625 · 2026-09-07
- PyTorch 基金会现身上海:月下载 8000 万次,探讨多元硬件开源栈 — PyTorch · 2026-09-07
- DEX-Comp 压缩 RAG 上下文 16 倍,性能反超未压缩基线 — _reachsumit · 2026-09-07
- Embedding Surgery:查询时局部修正文档向量,DG@10 提升可达 60% — _reachsumit · 2026-09-07
- SC Asia 2027 征稿启动:聚焦超算、AI 基础设施与量子,2027 年 3 月新加坡举办 — thoefler · 2026-09-07