开源说话人分离模型 SUPlime 超越 pyannote 商业版,基准 DER 15.86
solyarisoftware · x · 2026-09-12
Re:WayAI 团队开源了 SUPlime 说话人分离模型,打包为 pyannote.audio 4.x 插件。在 pyannote 8 语料库基准上宏平均 DER 为 15.86,超过了 pyannoteAI 的商业版 precision-2(16.06);在全部 12 个语料库上为 20.94。
- 提供两个规格:SUPlime 基于 WavLM-Base+(114M 参数),SUPlime-L 基于 WavLM-Large(349M 参数)
- SUPlime-L 在会议和对话音频上更强;基础版在远场和晚宴录音(CHiME-6、DiPCo、NOTSOFAR-1)上更优
- 架构为 Conformer 分段 + SimAM-ResNet34 嵌入,权重开放,含训练代码
- Alpha CEPHEI 转发称其在非英语电话音频上表现出色,接近 Diarizen Large V2
「模型」频道最新
- antirez 上传 DeepSeek V4.1 Flash GGUF 量化版到 Hugging Face — Queasy_Asparagus69 · 2026-09-12
- Qwen3.8-Max 在 OpenRouter 得分骤降,作者怀疑 effort 参数未被正确传递 — PawelHuryn · 2026-09-12
- Pipecat v1.9 发布:接入 Meta 流式语音转写模型 Muse,语义错词率最低 — solyarisoftware · 2026-09-12
- 爆料称 Google 工程师 IDE 内可用 Opus 5,引发两家合作猜测 — unironictechbro · 2026-09-12
- MiniCPM5-2B 上架 Hugging Face,作者称 Llama 架构可胜 Qwen3.5 — solyarisoftware · 2026-09-12
- 同一模型同一榜单分数大不同,DeepSeek 模型卡揭示评测失真 — solyarisoftware · 2026-09-12