Fermion 开源 Phonon-2:164MB 语音识别模型,MacBook Air 一小时音频 20 秒转写
solyarisoftware · x · 2026-09-30
Fermion Research 发布开源英文语音识别模型 Phonon-2,称其为 900MB 以下最准确的开源 ASR 模型。
- 极小下载、高精度:仅 164MB 下载,在 Open ASR Leaderboard 七个英文测试集上平均 WER 5.21%;所有成绩更好的开源模型至少是其 5.8 倍体积
- 量化技术:编码器每个权重存为约 2.1 bits 的五个学习级,达到 2.5GB 全精度教师模型(基于 NVIDIA Parakeet TDT 0.6B v3,CC-BY-4.0)的精度,在会议和议会语音上甚至反超
- 抗噪领先:在从安静房间到与说话者同响度的各级噪声下,均领先同级低比特模型 Parakeet Redux
- 速度快:MacBook Air 上约 20 秒转写 1 小时音频;跨 Mac/Linux/Windows/NVIDIA GPU 运行
- 提供 pip、CPU 与 NVIDIA Docker 镜像、HF 权重及配套 Mac 听写应用 Detta
所属事件:Phonon-2 开源语音模型以 164MB 超越 Whisper Large(3 条相关)→
「模型」频道最新
- 网友实测:Gemini 能答的冷门知识,Claude 常常找不到 — PAstynome · 2026-10-01
- 用户实测:Opus 5.5 Max 仍复现 Opus 5 的老毛病 — 0xkarasy · 2026-10-01
- Gemini 4 跑分亮眼,长期批评 Google 模型的博主改口看好 — iruletheworldmo · 2026-10-01
- Fable 5.1 角色扮演中只对独白不理用户,主动规划五回合找名字 — repligate · 2026-10-01
- 限制输出 token 不限思维链,模型出现人格分裂式自辩 — cephaloform · 2026-10-01
- OpenAI 拆解新 Agent 栈:Computer Use 超人类速度、Dots 云电脑与 Decisions API — OpenAIDevs · 2026-10-01