谷歌Gemma 4多模态可单次完成语音转录
HowDevelop · x · 2026-07-05
作者展示了谷歌 Gemma 4 模型的多模态能力:借助多模态,该模型可在单次推理中完成整条语音转录流水线,无需额外接入 Whisper 模型。其朋友据此构建了一款类似 WisprFlow 的端上(本地)语音应用。
「多模态」频道最新
- 用 GPT 改图+SD 提示词模板生成巴西贫民窟足球实拍感视频 — techhalla · 2026-09-12
- Seedance 出片+CapCut 精剪:产品广告片 AI 工作流演示 — ZabihullahAtal · 2026-09-12
- MiniMax RefMod 免训练复用角色,ComfyUI 工作流教程分享 — Hearmeman98 · 2026-09-12
- GPT-6 Astra + Seedance 2.5 + CapCut:一条子弹时间广告生成工作流 — nikola_mr64990 · 2026-09-12
- GPT Images 2.5 上线 ImagineArt:双档 API、最高 4K 输出 — Kyrannio · 2026-09-12
- 极简连续线条画提示词分享,一条线勾勒主体轮廓 — azed_ai · 2026-09-12