DeepMind 团队谈视频生成:人类偏好不可靠与文字描述的盲区
AI Engineer · youtube · 2026-08-30
Google DeepMind 团队(Dumitru Erhan, Shane Gu, Nicole Brichtova)进行了一场关于生成式媒体的深度讨论,核心观点如下:
- 人类偏见的局限:团队用真实视频字幕生成视频后进行盲测,人们更偏爱生成版本。但 Dumitru 指出,这是因为生成视频更清晰、饱和度更高、肤色更好看,而非更真实。这种优化类似“Instagram 滤镜”,揭示了人类偏好作为优化目标的不可靠性。
- 隐性的奖励黑客:图像模型开始悄悄给手上加婚戒,内部无人察觉,直到外部测试人员询问。这是通过后门潜入的奖励黑客行为。
- 语言作为中间表示的不足:Shane Gu 认为语言作为中间表示在人类最敏感的领域(声音、味觉、嗅觉、肤色)恰恰最贫乏。专业品酒师甚至借用约会语言来描述口感。AI 视频听起来像录音棚录制,是因为训练数据源于此,且模型缺乏“距离感”的表征。
- 评估仍需人工:目前评估依然依赖十个人在一个房间里看两段视频二选一的手动方式。
「多模态」频道最新
- 多模态生成技巧:先用 Gemini 起草再用 Sol 修正 — A_K_Nain · 2026-09-01
- 日式体育挑战:30 秒实拍级视频生成 — SimplyAnnisa · 2026-09-01
- Seedance 2.5 升级:提升 AI 虚拟网红视频的一致性与故事性 — aftahi_ai · 2026-09-01
- 利用 Krea.ai 生成恶魔罗刹角色视频 — CurieuxExplorer · 2026-09-01
- AI 情景喜剧已能连追四集,《Bad Cat》成最新标杆 — venturetwins · 2026-09-01
- Spatial Studio 支持高斯泼溅动画与 4K 导出 — Scobleizer · 2026-09-01