谷歌展示 Gemini Omni Flash:文本音频一键生成多角度视频
kimmonismus · x · 2026-08-07
Google 官方介绍了新模型 Gemini Omni Flash,该模型支持通过文本、图像、视频或音频作为参考,轻松创建和编辑高质量视频。
官方展示了开发者们利用该模型实现的创意项目,重点突出了其多角度镜头切换能力:用户可以在不丢失原始场景连贯性的情况下,自由改变摄像机角度、切换环境并应用电影级缩放。例如,有开发者利用该功能,从约 20 个不同的视角(包括特写、远景、俯视和仰视等)渲染了同一段人物画面。
所属事件:谷歌展示 Gemini Omni 视频生成模型(2 条相关)→
「多模态」频道最新
- Minimax H3能否为语音添加环境混响?用户实测提问 — diond09 · 2026-08-08
- DeepMind提出弹性循环Transformer,视觉生成参数量大减75% — adityakusupati · 2026-08-08
- 商汤 SenseNova U1 Pro 发布:原生 8K 分辨率,主打企业级商用出图 — SarahAnnabels · 2026-08-08
- 视频演示:如何用Ableton和AI创作音乐 — Puzzleheaded-Mall528 · 2026-08-08
- Minimax H3初测:基于REF2V工作流,效果不错 — dummy_anthropologist · 2026-08-08
- Minimax H3难保持混合性别特征,用户吐槽指令冗长 — Only_Voice569 · 2026-08-08