把视频塞进神经网络:790k参数记住27亿像素
thisdudelikesAI · x · 2026-08-12
有开发者将经典动画《Bad Apple》的 27 亿像素(1620 帧)完整压缩进了一个仅含 79 万参数、大小 3.2MB 的神经网络中。
核心思路:彻底抛弃传统视频基于帧和像素的存储方式,将视频转化为一个连续的数学函数。网络输入时间与坐标 (t, x, y),直接计算输出对应的像素值,相当于用权重“记住”了视频。
关键优化:
- 时间拉伸:将时间维度放大 4 倍,几乎零成本增加了时间容量。
- 聚焦运动采样:针对动画大面积纯黑的静态部分,改变均匀采样策略,将一半的训练批次集中在前后帧发生变化的动态像素上。
效果:验证集 MSE 从 0.0795 暴降至 0.0090(提升约 9 倍),398/400 帧的还原度得到提升。
作者指出,尽管 3MB 的体积比原始 700KB 视频大(压缩率不如传统编码),但这证明了“视频不存储而是被学习”的范式是可行的,未来扩展到更大网络、真实视频甚至音频极具想象空间。
「研究」频道最新
- Falcon-Perception 技术报告:0.6B 模型在分割任务上击败 SAM 3 — vanstriendaniel · 2026-08-12
- Falcon-Perception 0.6B 模型实现高效本地图像分割 — vanstriendaniel · 2026-08-12
- CEPR 论文:企业 AI 投入的经济影响与衡量框架 — TaniaBabina · 2026-08-12
- ECCV 2026论文LeAD-M3D:无需雷达的实时单目3D检测新SOTA — rsasaki0109 · 2026-08-12
- 开发者解决图像生成模型多轮编辑中的图像退化问题 — imdigitalashish · 2026-08-12
- InSight-doc:自适应视觉分辨率提升长文档理解并降幻觉 — Kaican Li · 2026-08-12