把视频塞进神经网络:790k参数记住27亿像素

thisdudelikesAI · x · 2026-08-12

有开发者将经典动画《Bad Apple》的 27 亿像素(1620 帧)完整压缩进了一个仅含 79 万参数、大小 3.2MB 的神经网络中。

核心思路:彻底抛弃传统视频基于帧和像素的存储方式,将视频转化为一个连续的数学函数。网络输入时间与坐标 (t, x, y),直接计算输出对应的像素值,相当于用权重“记住”了视频。

关键优化:

效果:验证集 MSE 从 0.0795 暴降至 0.0090(提升约 9 倍),398/400 帧的还原度得到提升。

作者指出,尽管 3MB 的体积比原始 700KB 视频大(压缩率不如传统编码),但这证明了“视频不存储而是被学习”的范式是可行的,未来扩展到更大网络、真实视频甚至音频极具想象空间。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →