MLVC: Multi-platform Learned Video Codec for Real-World Deployment
Tanel Pärnamaa, Martin Lumiste, Ardi Loot, Evgenii Indenbom, Andrei Znobishchev, Ando Saabas
ECCV 2026
eess.IV, cs.AI, cs.CV, cs.LG
2026-06-26
把尺度参数直接编进码流,绕开跨平台解码崩溃;在苹果、英特尔、高通 NPU 上编解码均达 100 帧,主观质量比硬件 HEVC 省 70% 以上码率。
神经视频编码器(neural video codec)用神经网络替换 HEVC 这类传统编解码器,在压缩率上已经反超。但落到产品里始终过不了两关:一是计算太重,跑不动;二是更致命的跨平台问题。
视频会议这类场景,编码端和解码端天然在不同设备上,常常还是不同厂商的芯片。论文给了一个直观的失败案例:在苹果 M3 NPU 上编码,换到英特尔 NPU 上解码,当前最强的神经编码器 DCVC-RT 输出的画面直接花掉。
根子在熵编码。神经编码器要靠一个尺度参数 σ 去描述隐变量的分布,再据此做熵解码。编码端和解码端各自用各自的浮点硬件算 σ,差一点点就会随时间累积放大,把整段预测链带崩。直觉的修法是量化到 INT8,但行不通:苹果神经引擎是用 FP16 模拟 INT8,各家编译器又各有取舍,根本做不到逐位一致。
MLVC 的核心是一招「把尺度参数直接发过去」。不再让两端各自算 σ,而是把 σ 经过结构化参数共享压缩 128 倍后,塞进超先验(hyperprior)一起编进码流。两端从同一份码流里读出 σ,熵解码自然一致,不再依赖逐位精确的算术。代价是码率变高。
接下来用四组改动把丢掉的效率找回来:
在 VCD 视频会议基准上对标硬件 HEVC-QSV(可部署的最强传统基线):
| 设置 | 指标 | 结果 |
| DCVC-RT 同平台 | PSNR BD-rate | -69.6% |
| DCVC-RT 跨平台 | PSNR BD-rate | ∞(解码崩溃) |
| MLVC 跨平台 | PSNR BD-rate | -58.7% |
| MLVC 主观(MOS,360p) | BD-rate | -75.5% |
| MLVC 码率阶梯综合 | MOS BD-rate | -71.8% |
| DCVC-RT 主观(同平台) | MOS BD-rate | -81.9% |
DCVC-RT 同平台确实更强,但跨平台直接崩溃,等于不可部署。MLVC 同平台比 DCVC-RT 差约 18 个百分点,这正是跨平台约束的直接代价。在所有能真正跨平台解码的神经编码器里,MLVC 领先幅度很大:HEVC B 上 -45.2%,而此前的固定先验方案是 +15.0%。
速度上,编码和解码在三家 NPU 上平均都过百帧:苹果 M3 Pro 在 360p 下 129.5 编码 / 122.9 解码,英特尔 Lunar Lake 98/98,高通骁龙 X 80/77.5。跨平台验证里,各家芯片两两配对的 BD-rate 基本都在 2 个百分点以内。更大的 MLVC-S 模型能在 1080p 下跑到 30 帧,仍保持 -37% 的 BD-rate。
这是第一个同时满足跨平台稳健、消费级 NPU 实时、压缩率够用的神经视频编码器。对视频会议这类端到端、跨厂商的场景,此前神经编码器基本是空中楼阁。微软把它开源(github.com/microsoft/mlvc),并明确冲着消费级 NPU 而非高端 GPU 做优化,目标就是大规模部署。PSNR 上比同平台的 DCVC-RT 差一截,这部分取舍换来的是「真能跑起来」,对落地来说划算。
作者自己点出:功耗会是下一个优化重点,实时跑通后耗电问题凸显;单设备上同时编解码高分辨率(1080p 以上)对对称架构仍有挑战;统一的 I/P 帧模型为了部署简单牺牲了码率;跨平台必须定期插 I 帧,这部分开销在单平台下并不需要。还有一处要存疑:主观质量的对标基线基本只有 HEVC-QSV,更强的传统编码器 VTM/ECM 因没有消费级硬件实现被略过,「最强可部署基线」这个定位本身就要打折理解。