EvolvingAvatar:测试时训练让 3D 数字人头随对话进行越用越像你
HFUT-AI · hf · 2026-09-29
交互式 3D 头像生成需要说话与倾听动作随对话演进协调变化,但现有生成器参数固定,不会把对话模式当作学习信号。EvolvingAvatar 引入因果生成器,在交互中用 test-time training 适应用户面部视频和双人音频:
- 双人上下文预测目标提供自监督信号,无需测试时动作标签
- 持久快速权重在会话内累积更新以引导动作生成,瞬态下颌适配响应当前音视频上下文,语音活动预测控制持久适配的介入程度
- 发布 InterHead-Bench:基于单/双视角对话视频构建的 455.95 小时统一基准
- 在最难的分布外划分上,生成质量随对话推进持续提升,用户-头像表情统计失配最多降低 11.1%
「多模态」频道最新
- 实测:角色交换 LoRA 显著提升 MiniMax H3 视频一致性 — not_food · 2026-09-29
- 开源增强节点实测:Krea2 turbo 8 步出图质量明显提升 — No-Bad-4838 · 2026-09-29
- 小技巧:ControlNet Depth 的 end_percent 设低于 0.5 效果出奇好 — MaleMaldives · 2026-09-29
- Reddit 爆火 AI 视频:哈利波特与「健身房密令」 — iquizuanswer · 2026-09-29
- 用 Claude+Seedance 复刻 Manus 2.0 风格产品发布片 — yihui_indie · 2026-09-29
- WorldPlay2:更可控更长时程的实时交互世界模型 — Haiyu Zhang · 2026-09-29