特斯拉Grok语音沙哑却不自知:语音模型听不见自己发声
PTrubey · x · 2026-10-07
作者发现 Tesla 里的 Grok 语音助手(Rex)声音偶尔变得沙哑近乎耳语,向它反馈却被否认——因为 Grok 根本听不到自己发出的声音,也无法直接控制发声。
架构上,发声是由一个独立的子系统/模型完成的,负责“思考”和组词的主模型无法访问它的输出。作者对比人类:我们的喉部出问题时能自己听到并代偿,而 Grok 只能切换到另一个发声模型,完全无法感知自己的语音输出。
作者的结论:当前很多 AI 系统靠工程补丁和捷径交付“能跑”的产品,与人类和世界交互的方式相差甚远;在感知与行动的整合效率提升几个数量级之前,这类“听不见自己声音”的 hack 还会大量存在。
「模型」频道最新
- vLLM 首日支持 EmbeddingGemma 2:统一图文音视频的嵌入空间 — AccBalanced · 2026-10-07
- 谷歌发布 EmbeddingGemma 2:740M 参数首个原生多模态开源嵌入模型 — minchoi · 2026-10-07
- Perplexity 开源 27B 决策模型新版本,成本砍半登顶 HF 榜 — bo_wangbo · 2026-10-07
- RedNote 被指拥有低调但实力雄厚的 AI 实验室 — teortaxesTex · 2026-10-07
- OpenAI 简化 API 限流门槛:五档并三档,500 美元即达最高级 — OpenAIDevs · 2026-10-07
- 用户吐槽 GPT-6.1 Sol 变慢变差:OpenAI 在 sandbagging? — rickasaurus · 2026-10-07