Building Speech AI 电子书上架:从频谱图讲到实时语音 Agent
prdeepakbabu · x · 2026-09-26
《Building Speech AI》Kindle 版正式上线,全书覆盖语音 AI 完整技术栈:从频谱图与 MFCC 等传统特征,到 wav2vec、Whisper 等语音模型,再到神经 TTS、说话人分离(speaker diarization)、音频语言模型,以及实时语音 Agent 背后的延迟工程。
每章都配有可运行的 Python 代码,适合想系统入门语音方向、或正在构建语音 Agent 的开发者。
所属事件:《Building Speech AI》电子书上架,配套代码全开源(2 条相关)→
「模型」频道最新
- Opus 5.5 造的游戏会同步纽约真实天气,NPC 下雨天撑伞 — mattshumer_ · 2026-09-26
- Opus 5.5 无视明确指令打包了旧 Expo 应用,被讽“已脑叶切除” — haydendevs · 2026-09-26
- 谈开放权重基本就是在谈中国:开源 AI 已被中国实验室主导 — FinanceYF5 · 2026-09-26
- Artificial Analysis 两年内评测项从 4 个扩到 10 个,新增长程 Agent 任务 — davidyin44 · 2026-09-26
- 用户吐槽 Claude 周额度:一周还没过半已用 5% — ColleenMBrady · 2026-09-26
- ChatGPT 凭空编造一届世界杯,作者总结 5 分钟幻觉检测法 — Adventurous-Draft870 · 2026-09-26