Google DeepMind 推出 Gemini 3.5 Transcribe
Google DeepMind · rss · 2026-08-27
Google DeepMind 发布了 Gemini 3.5 Transcribe,提供更智能的语音转文字转录功能。
「多模态」频道最新
- 美图 MT Lab 提出 CFT 方法,解决人像重光照身份走样问题 — jiqizhixin · 2026-08-27
- Flux.3 模型最多支持 8 张参考图实测 — R34vspec · 2026-08-27
- 实测 15 秒 768p 视频生成耗时 5 秒 — umesh_ai · 2026-08-27
- 视觉通用智能白皮书:探讨视觉模态通往 AGI 的路径 — zhenjun_zhao · 2026-08-27
- 视频生成提速300倍:Jevons悖论下的创作可能 — gorkem · 2026-08-27
- V-Rubrics:基于规则强化学习的视觉保真度 — nanyang-technological-university-singapore · 2026-08-27