受控研究显示,文本到视频模型高度依赖训练数据质量

Amber Yijia Zheng · hf · 2026-07-23

Moving Alphabet 研究 训练数据 如何影响文本到视频生成,并搭建了一个可控的程序化测试平台。

论文通过生成不同字体、颜色、大小、位置、方向和速度的字母视频,再故意破坏元数据,来隔离分析数据分布和字幕质量的作用。主要结论包括:

作者据此强调,大规模视频生成研究不应只盯着模型结构,也要更重视预训练数据科学。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →