Building Speech AI 电子书上架:从频谱图讲到实时语音 Agent

prdeepakbabu · x · 2026-09-26

《Building Speech AI》Kindle 版正式上线,全书覆盖语音 AI 完整技术栈:从频谱图与 MFCC 等传统特征,到 wav2vec、Whisper 等语音模型,再到神经 TTS、说话人分离(speaker diarization)、音频语言模型,以及实时语音 Agent 背后的延迟工程。

每章都配有可运行的 Python 代码,适合想系统入门语音方向、或正在构建语音 Agent 的开发者。

所属事件:《Building Speech AI》电子书上架,配套代码全开源(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →