16.9MB 端侧语音识别模型 Whistle 开源:11ms 出首 token 支持 7 种语言

solyarisoftware · x · 2026-10-09

Cactus 团队发布开源语音识别模型 Whistle,整个模型仅一个 16.9 MB 文件,可在手机、可穿戴、机器人、智能家居、汽车甚至微控制器的 CPU 上零依赖运行。

核心能力(全部端侧完成):

技术上采用 25ms 窗口/10ms 跳帧提取 80 维 log-mel 特征,卷积 stem(128 通道、kernel 9)三次降采样将 3000 帧压缩到 375 帧。模型与同家的 Needle 小型基础模型(8-29MB)共用同一个 C++ 引擎与量化方案,可同时加载,实现语音直转工具调用。官方页面可直接在浏览器标签页内试用,音频不上传。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →