Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+
netflix · hf · 2026-10-02
Netflix 提出 Align Then Reason(ATR),一个多语言口型同步裁判模型,用于配音质检:仅需无声视频与候选台词,判断台词是否与说话人嘴部动作在内容和时序上都匹配,无需参考已配音的音频。
方法与结果:
- 现有视觉语音识别与视频语言模型对时序错误不敏感;ATR 先在帧级唇部表征与候选台词的音位单元之间建立单调对齐,再让 LLM 结合每个音位的局部证据与校准后的全局对齐分数做联合推理;
- 七语言基准上,ATR 相对 Qwen3.5 SFT 基线在 2B/4B/9B 推理器上平均 AUC 提升 59.4%/50.2%/50.8%;跨 LLM 家族(LLaMA-3.1-8B、Mistral-7B)提升约 46%;
- 能迁移到三个未见 MuAViC 语言;在真实配音台词的下游任务中,台词重排优于最佳唇读基线 52.0%,脚本-片段分配提升 17.7%。
「多模态」频道最新
- 实测:用 Nano Banana 做图像编辑,效果直接看图 — tkasasagi · 2026-10-02
- 博主实测:Opus 5.5 剪视频很强,但无需求硬用产出多垃圾 — AlchainHust · 2026-10-02
- Reddit 用户用 AI 做出以假乱真的概念车动态视频 — Vashukanni · 2026-10-02
- Fable 5.5 曝光:网页能随经过图片的艺术风格实时变形 — lxfater · 2026-10-02
- 牛津 VGG 发布 SynCity 3000:一次生成全局连贯的大规模 3D 场景 — rsasaki0109 · 2026-10-02
- Omni-Embed-Mini:0.9B 参数统一嵌入六种模态且文本检索零退化 — _reachsumit · 2026-10-02