Cartesia 创始人:语音模型难点在持续状态而非语音本身
rohanpaul_ai · x · 2026-09-22
作者指出一个常被忽视的假设:同一套模型架构未必同时适合"思考"与"交互"。语音模型的任务特殊——不能只给出正确答案,还要在对话序列不断变长时跟上真人节奏。
作者认为,语音 AI 的真正难点可能不在"语音"这个抽象层,而在"持续状态"的维护。Cartesia 创始人在访谈中解释,他们是从序列建模而非语音研究切入这个领域的,这大概解释了为什么他们如此重注状态空间模型(SSM)。完整视频见 "The Neon Show" 频道。
所属事件:Cartesia 创始人:语音 AI 难点在持续状态而非语音(2 条相关)→
「模型」频道最新
- Grok 4.7 曝光:开源世界城市游戏对比显示远强于 4.6 — belce_dogru · 2026-09-22
- tiny 分类模型 Jev 对打 Claude 全家桶:自测文本理解不落下风 — vesko_st · 2026-09-22
- 自建防背诵基准实测:微型分类模型 Jev 达 Sonnet 水平、便宜约 150 倍 — vesko_st · 2026-09-22
- HLE 榜单:Grok 4.7 居第 21,Gemini 3.8 与 Muse 1.3 领跑 — himanshustwts · 2026-09-22
- Grok 4.7 编码实测翻车:Terminal-Bench 4.0 成绩难看 — daniel_mac8 · 2026-09-22
- Grok 4.7 上线 Vercel AI Gateway:50 万上下文,9 月 27 日前 6 折 — cramforce · 2026-09-22