Cactus 发布 16.9MB 语音识别模型 Whistle,CPU 端侧运行胜 Whisper base
ycombinator · x · 2026-10-03
Cactus 团队开源发布语音识别模型 Whistle:整个模型仅 16.9MB,可在 CPU 上无依赖运行,与他们的端侧基础模型 Needle 共用同一 C++ 引擎和量化方案。
关键信息:
- 性能:体积比 Whisper base 小 9 倍,速度约快 6 倍,整体效果大多优于 Whisper base
- 多语言:支持英语、德语、法语、西班牙语、意大利语、荷兰语、波兰语 7 种语言,自动检测语种
- 三种能力:转录(16kHz 单声道,单次最长 30 秒)、词级时间戳(含起止时间与概率)、语音嵌入(每 80ms 帧输出一行,无需解码)
- 极低延迟:首 token 仅 11ms,可加载在 Needle 旁,一个二进制即可把音频直接转为工具调用
- 定位:面向手机、可穿戴、机器人、智能家居、汽车与单片机等端侧场景,音频不出设备
官方页面提供浏览器内 sandbox,可直接试听体验。
「Infra」频道最新
- Cerebras CEO 揭秘:晶圆级架构推理为何比 GPU 快 2500 倍 — rohanpaul_ai · 2026-10-03
- Cerebras CEO 晒自建 42MW 发电机组,算力电力一体化再进一步 — dunkhippo33 · 2026-10-03
- Prime Intellect 推出自有推理栈 Prime Inference,已服务万亿 token — xeophon · 2026-10-03
- Sam Altman 证实 OpenAI 与 Cerebras 深度合作,共推推理速度前沿 — sama · 2026-10-03
- CUDA 护城河松动:DeepSeek 让昇腾可用,摩尔线程做 CUDA→MUSA 转译 — teortaxesTex · 2026-10-03
- Epoch AI:现有芯片可同时跑 19 亿个智能体,相当于全人类工时 — 141_1337 · 2026-10-03