15 段临床对话实测:Pyannote 3 错误率最低,Nemotron 3 最快
MajesticAd2862 · reddit · 2026-09-26
Omi 开发者在 15 段约 2.4 小时的模拟医患对话(PriMock57)上对比了主流说话人分离(diarization)模型,数据与评分工具已开源。
批量处理(DER,越低越好)
- Pyannote Precision-3:2.891%(API,18.9s/条)
- Nemotron 3:4.803%,但是最快的本地模型(0.688s/条,单卡 L4)
- Pyannote Community-1:6.620%;Sortformer v1:6.778%;v2.1:7.974%
- VibeVoice-ASR:8.233%(123s/条);Meta Muse Voice Transcribe:13.042%(因 10 分钟请求限制拆分测试,非整段对比)
流式场景:Pyannote live API 3.959%,Nemotron 3 4.971%,Sortformer v2.1 6.958%,VibeVoice 1.5B/7B 均超 17%。
同权重换运行时:不改权重仅优化推理运行时,Nemotron DER 从 4.803% 降到 3.174%(错误降 34%、快 2.13 倍);Community-1 从 6.620% 降到 5.435%(快 24 倍)。作者注明测试集较小且运行时参数在其上调优,结论需谨慎解读。
「模型」频道最新
- Lukas Kaiser 揭秘:清洗模型推理轨迹造合成数据再上 RL — lukaszkaiser · 2026-09-26
- 长数字计算无容错:LLM 需逐 token 确定性算对才算会算术 — ctjlewis · 2026-09-26
- OpenRouter 叹模型发布节奏:从每月一款到每天一款,追新成了全职工作 — jeff_weinstein · 2026-09-26
- 文本分析显示 Claude Opus 5.5 句子短 17%,破折号减少 95% — arena · 2026-09-26
- 研究者称大模型已把 2×2 乘法「记熟」,一步算出无需中间步骤 — ctjlewis · 2026-09-26
- DL Weekly 第474期:GPT-6 Sol/Luna、AI Evals 指南与 RRSI 论文 — dl_weekly · 2026-09-26