Fish Audio ASR 升级:识别说话人、标注情绪,支持 83 种语言
TheMoonMidas · x · 2026-09-29
Fish Audio 发布 ASR(语音转文字)模型更新,宣称要让转录不再「无聊」:
- 识别并区分不同说话人
- 理解说话人的情绪状态
- 在转录文本中标注情绪线索,如 [laughter]、[surprised]
- 支持 83 种语言,官方称其为最准确的 STT 模型
现已开放试用。
「多模态」频道最新
- MiniMax H3 生态周报:角色替换 LoRA、80年代科幻 LoRA 与 ComfyUI Face Refine 节点 — optimisticalish · 2026-09-29
- 压手机 7 年的歌,用 Suno + Claude 纯代码做成 MV — lellorocks · 2026-09-29
- 全曲由 Suno 生成的音乐作品刷屏,作者称音乐业将被改写 — astralmatrix · 2026-09-29
- Sonnet 5.5 比 Opus 5.5 便宜一半还更快,实测连做 7 支 AI 视频 — petergyang · 2026-09-29
- 开源视频创作工具 vlo 0.3:为 AI 合成打造时间线级精确控制 — PxTicks · 2026-09-29
- 激活强度微调后,Qwen3-8B 写出了另一首歌 — sterlingcrispin · 2026-09-29