微软发布 MAI-Transcribe 2:支持多语言转写、说话人分离与时间戳
lee_stott · x · 2026-09-23
微软员工 Lee Stott 转发开发者 Bethany Jep 对 MAI-Transcribe 2 的实测:新模型更新了语言支持,具备说话人分离(speaker diarization)和更细的时间戳能力,可转写多语言混合对话。Bethany 还发布了一个配套 notebook 演示实际用法,托管在 GitHub 的 microsoft-foundry/model-releases 仓库中,读者可直接试用。
「多模态」频道最新
- 博主称 Opus 5.5 一次性生成完整 newsletter 上线视频 — alex_verem · 2026-09-23
- PixVerse R2 实测:视频模型不再是片段,而是能 WASD 走进去的世界 — HeyAmit_ · 2026-09-23
- 一人包揽 AI 音乐 MV:作者实测全流程,称「单人制片厂」不到一年 — kraussian · 2026-09-23
- MiniMax H3 Ref2VA 实测:第 8 张参考图触发初始化卡死 — itchplease · 2026-09-23
- H3 长视频画质衰减有解:二次精修注入噪声稳住 latent — xyzdist · 2026-09-23
- 开发者用 Codex+GPT Image 2.5 自动生成角色替换 LoRA 数据集 — ostrisai · 2026-09-23