神经视频编码器换台设备就花屏:微软 MLVC 跨平台跑出 100 帧

MLVC: Multi-platform Learned Video Codec for Real-World Deployment

Tanel Pärnamaa, Martin Lumiste, Ardi Loot, Evgenii Indenbom, Andrei Znobishchev, Ando Saabas

ECCV 2026

eess.IV, cs.AI, cs.CV, cs.LG

2026-06-26

把尺度参数直接编进码流,绕开跨平台解码崩溃;在苹果、英特尔、高通 NPU 上编解码均达 100 帧,主观质量比硬件 HEVC 省 70% 以上码率。

这篇在解决什么

神经视频编码器(neural video codec)用神经网络替换 HEVC 这类传统编解码器,在压缩率上已经反超。但落到产品里始终过不了两关:一是计算太重,跑不动;二是更致命的跨平台问题。

视频会议这类场景,编码端和解码端天然在不同设备上,常常还是不同厂商的芯片。论文给了一个直观的失败案例:在苹果 M3 NPU 上编码,换到英特尔 NPU 上解码,当前最强的神经编码器 DCVC-RT 输出的画面直接花掉。

根子在熵编码。神经编码器要靠一个尺度参数 σ 去描述隐变量的分布,再据此做熵解码。编码端和解码端各自用各自的浮点硬件算 σ,差一点点就会随时间累积放大,把整段预测链带崩。直觉的修法是量化到 INT8,但行不通:苹果神经引擎是用 FP16 模拟 INT8,各家编译器又各有取舍,根本做不到逐位一致。

方法

MLVC 的核心是一招「把尺度参数直接发过去」。不再让两端各自算 σ,而是把 σ 经过结构化参数共享压缩 128 倍后,塞进超先验(hyperprior)一起编进码流。两端从同一份码流里读出 σ,熵解码自然一致,不再依赖逐位精确的算术。代价是码率变高。

接下来用四组改动把丢掉的效率找回来:

结果

在 VCD 视频会议基准上对标硬件 HEVC-QSV(可部署的最强传统基线):

设置指标结果
DCVC-RT 同平台PSNR BD-rate-69.6%
DCVC-RT 跨平台PSNR BD-rate∞(解码崩溃)
MLVC 跨平台PSNR BD-rate-58.7%
MLVC 主观(MOS,360p)BD-rate-75.5%
MLVC 码率阶梯综合MOS BD-rate-71.8%
DCVC-RT 主观(同平台)MOS BD-rate-81.9%

DCVC-RT 同平台确实更强,但跨平台直接崩溃,等于不可部署。MLVC 同平台比 DCVC-RT 差约 18 个百分点,这正是跨平台约束的直接代价。在所有能真正跨平台解码的神经编码器里,MLVC 领先幅度很大:HEVC B 上 -45.2%,而此前的固定先验方案是 +15.0%。

速度上,编码和解码在三家 NPU 上平均都过百帧:苹果 M3 Pro 在 360p 下 129.5 编码 / 122.9 解码,英特尔 Lunar Lake 98/98,高通骁龙 X 80/77.5。跨平台验证里,各家芯片两两配对的 BD-rate 基本都在 2 个百分点以内。更大的 MLVC-S 模型能在 1080p 下跑到 30 帧,仍保持 -37% 的 BD-rate。

为什么重要

这是第一个同时满足跨平台稳健、消费级 NPU 实时、压缩率够用的神经视频编码器。对视频会议这类端到端、跨厂商的场景,此前神经编码器基本是空中楼阁。微软把它开源(github.com/microsoft/mlvc),并明确冲着消费级 NPU 而非高端 GPU 做优化,目标就是大规模部署。PSNR 上比同平台的 DCVC-RT 差一截,这部分取舍换来的是「真能跑起来」,对落地来说划算。

局限与存疑

作者自己点出:功耗会是下一个优化重点,实时跑通后耗电问题凸显;单设备上同时编解码高分辨率(1080p 以上)对对称架构仍有挑战;统一的 I/P 帧模型为了部署简单牺牲了码率;跨平台必须定期插 I 帧,这部分开销在单平台下并不需要。还有一处要存疑:主观质量的对标基线基本只有 HEVC-QSV,更强的传统编码器 VTM/ECM 因没有消费级硬件实现被略过,「最强可部署基线」这个定位本身就要打折理解。

术语

原文与代码

社区讨论

相关论文

全部论文解读