16.9MB 端侧语音识别模型 Whistle 开源:11ms 出首 token 支持 7 种语言
solyarisoftware · x · 2026-10-09
Cactus 团队发布开源语音识别模型 Whistle,整个模型仅一个 16.9 MB 文件,可在手机、可穿戴、机器人、智能家居、汽车甚至微控制器的 CPU 上零依赖运行。
核心能力(全部端侧完成):
- 转写:16kHz 单声道音频,单次最长 30 秒,支持英、德、法、西、意、荷、波 7 种语言,自动检测语言
- 词级时间戳:输出每个词的起止时间与概率,由 decoder attention 对齐
- 语音 embedding:encoder 每 80ms 帧输出一行,无需解码转写
技术上采用 25ms 窗口/10ms 跳帧提取 80 维 log-mel 特征,卷积 stem(128 通道、kernel 9)三次降采样将 3000 帧压缩到 375 帧。模型与同家的 Needle 小型基础模型(8-29MB)共用同一个 C++ 引擎与量化方案,可同时加载,实现语音直转工具调用。官方页面可直接在浏览器标签页内试用,音频不上传。
「模型」频道最新
- 开源 NSFW 图像分类器 Blue-Eye 跑分 88.9%,胜过 AWS 与 Google Vision — Mundane_Toe_8074 · 2026-10-09
- 评测显示所有模型都差?作者发现答案密钥取错了时间点 — jgarg27 · 2026-10-09
- Ai2 高管回应质疑:下一代 Olmo 模型已在训练,全面开源路线不变 — sewon__min · 2026-10-09
- Nous Research 误发「Hemres Agnet」,或预告 Hermes Agent 到来 — Teknium · 2026-10-09
- 研究:过期版 Gemini 问诊建议获医生评同医生相当且无安全问题 — emollick · 2026-10-09
- Scott Aaronson:AI 惊奇与恐怖的时代已经到来,怀疑论该醒了 — scottleibrand · 2026-10-09