用 Gemini 做音频转写+动态字幕+硬件加速渲染的完整视频工作流
AI_Andrew · x · 2026-09-24
作者完整复盘了用 Gemini 处理一段屏幕录制视频(IMG7017.mov)并做成发布级宣传片的全流程:
- 音频转写:用 Gemini 对视频音频做转写,获得逐字文本。
- 动态字幕:按词级(word-level)打 kinetic subtitle 动效样式,让字幕跟随语音节奏出现。
- B-roll 插入:在转写内容的对应时间点切入发布会画面等 cutaway 素材。
- 渲染输出:硬件加速渲染,产出 1920×1080、60fps、约 18.6 Mbps 的 MP4 母版(faststart + AAC 立体声),并同时镜像一份到源目录。
帖子里给出了成片规格表和目录结构,是一套可复现的 AI 视频后期流水线。
「多模态」频道最新
- Artificial Analysis 发布 TTS 语音生成对比榜,含发音鲁棒性基准 — ArtificialAnlys · 2026-09-24
- 谷歌 Gemini 3.8 Flash TTS 曝光:缩写与语境发音示例流出 — ArtificialAnlys · 2026-09-24
- 附试听样例:Gemini 3.8 Flash TTS 语境恰当发音分类演示 — ArtificialAnlys · 2026-09-24
- Artificial Analysis 发音鲁棒性榜:Gemini 3.8 Flash TTS 以 89.5% 登顶 — ArtificialAnlys · 2026-09-24
- Runway CEO 断言「最终交互界面是视频」,实时视频界面 demo 同步亮相 — _AustinCalvert_ · 2026-09-24
- 在 Mac 上搭了个本地小工作室,实测 Qwen-Image-2.1 出图 — janishar · 2026-09-24