Tavus 发布 Griffin:开口先于生成完成,音画延迟仅 0.43 秒
TejasKumar_ · x · 2026-10-03
开发者实测 Tavus 新发布的实时数字人模型 Griffin,核心突破在于打破了传统「你说完→我再说」的接力式语音交互:
- 永不停止的对话模型:全程听、全程看,每时每刻都在决定该说话、反应还是等待,输出时机、姿态、表情与手势控制信号;它是因为你说了什么而接管话轮,而不是因为声音停了,所以「停下来想」不会被打断。
- 不等句子的语音:把每 10ms 音频压缩成 40 个数字的 latent,模型一知道要说什么就立刻写出下一个 latent 并即时播放——像人一样边说边想句子结尾;还可用约 10 秒音频克隆声音。
- 不等音频的脸:griffin-lite 逐 latent 渲染、零前瞻,H100 上音到画延迟 0.43 秒,是实测中次优方案的一半。
- 整场景渲染:所有像素来自 1 张参考图,椅子会动、影子跟随,而非把假脸贴在背景上。
作者感叹这再次提出了「人类角色」的追问,但技术上非常惊艳。
「多模态」频道最新
- 创作者用 ML 学习真人运动信号,为抽象图像注入「生命的错觉」 — pixlpa · 2026-10-03
- Runway 世界模型转战机器人:Praxis-1 只需几分钟演示数据 — c_valenzuelab · 2026-10-03
- 博纳 AI 电影《三星堆:未来启示录》过审,10月23日全国上映 — lmoroney · 2026-10-03
- AI 导演 Junie Lau 登上 Forbes,新片《Goldfish Mayhem》下周首映 — JunieLauX · 2026-10-03
- fal H3 Max 视频生成新增首/中/尾帧关键帧控制 — OdinLovis · 2026-10-03
- 在 ChatGPT Dots 里跑 Blender,AI 自己建模绑骨还配了乐 — OpenAIDevs · 2026-10-03