我用 Claude 打造真实可用的语音助手:架构设计与三大致命 Bug
No_Rush5021 · reddit · 2026-07-31
作者分享了基于 Claude 构建实用个人语音 AI 助手的完整架构与踩坑经验。
核心架构:本地唤醒词触发 → 带静音检测的录音 → 本地 Whisper 语音转写 → Claude 结合工具执行任务 → 流式语音回复。
关键设计:
- 记忆管理:拆分为固定人设指令、临时对话上下文和持久化事实文件(纯文本,只增不改)。
- 工具安全:只读操作放行,可逆写操作(建日程)直接执行,不可逆危险操作(发邮件、退款)绝不提供真实工具,而是生成草稿交由人工确认。
- 子智能体:当工具列表超 30 个时,引入廉价模型先将请求分类,再路由给特定领域的专家 Agent,以提升准确率。
三大致命 Bug:
- 自言自语中断:麦克风收录到扬声器声音,通过引入声学回声消除(AEC)解决。
- 唤醒词静默失效:依赖库版本漂移导致模型输出全是乱码且无报错。
- 系统彻底死锁:同一麦克风被同时开启两个音频流触发底层冲突,需强制结束进程。
「编程与Agent」频道最新
- 实战:用 HF 推理端点部署 Qwen 嵌入模型 — NielsRogge · 2026-07-31
- Hugging Face 专家分享:通过蒸馏代码轨迹训练智能体 — mervenoyann · 2026-07-31
- Kaggle推出Kaggriculture模拟竞赛:打造农场经营自主Agent — JFPuget · 2026-07-31
- 用Google ADK 2.0与A2UI构建可靠的AI Agent系统 — SucceededMind · 2026-07-31
- Blockstream 称前沿大模型正发掘加密设备漏洞 — RSync25 · 2026-07-31
- DeepSeek-V4-Flash 接入 Codex:成本仅为 Opus 的近 90 分之一 — teortaxesTex · 2026-07-31