专题 · FULL STORY

Eleven v4 发布:双榜登顶的TTS新王

9 月 28 日 ElevenLabs 发布新一代语音模型 Eleven v4 与 v4 Turbo,官方称其更快、情感表现力更强,并在独立评测中双榜登顶;随后开发者上手实测,盛赞语音逼真度达前所未有的水平。

2026-09-28 ~ 2026-09-29 · 2 集 · 19 条

第 1 集 · ElevenLabs 发布 Eleven v4 与 v4 Turbo,双榜登顶 TTS(2026-09-28,17 条)

9 月 28 日,ElevenLabs 发布新一代文本转语音模型 Eleven v4 与 v4 Turbo,官方称这是公司迄今最快、情感表现力最强的版本。独立评测机构 Artificial Analysis 的数据显示,Eleven v4 双双登顶 Provider Voice 竞技场与发音鲁棒性基准,确立其在 TTS 领域的领先地位;但 80 美元/百万字符的定价约为谷歌竞品的 5 倍,性能与成本的权衡成为用户选型的关键考量。

已确认

  • ElevenLabs 官方发布 Eleven v4 与 v4 Turbo 两款模型,v4 采用新架构,可按预期的语气、节奏、情绪和角色生成语音,强调情感表达、面向构建创意体验的开发者;v4 Turbo 主打低延迟(@NevFlynn、@testingcatalog)
  • 团队发布交互 demo,展示在提示词中加入 [audio tags] 音频标签(如 [excited]、[playful]、[amazed])逐词控制模型情绪的能力(@NevFlynn)
  • 开发者 korymath 介绍,v4 允许同时「导演」角色的表演与周围的声音环境,支持语音效果处理(如「廉价麦克风」音色)(@korymath)
  • ElevenLabs 成员 lukeharries 演示升级版语音克隆,称其为公司最快、情感表现力最强的模型,已上线 ElevenCreative、ElevenAgents 和 ElevenAPI(@lukeharries)
  • Provider Voice 竞技场第一:Elo 1,319,1,674 次出场,领先 Cartesia Sonic 3.6(1,276)、Gemini 3.8 Flash TTS(1,267),阿里 Qwen 紧随其后(@ArtificialAnlys)
  • 发音鲁棒性基准登顶,覆盖缩写展开等四个类别,其中三类得分超 93%,由人类评审按约定标准发音逐条判定;支持语言扩展至 90+(@ArtificialAnlys)
  • 生成速度 73.4 字符/秒,较 v3 的 42.5 字符/秒大幅提升;定价 80 美元/百万字符,约为谷歌竞品的 5 倍(@ArtificialAnlys)
  • Artificial Analysis 在发布线程放出客服话术与黑洞科普两段样音,展示模型在真实语境下的表现(@ArtificialAnlys)
  • 第三方用户 mati 在 X 上转发评测,称 Eleven v4 在对比中「明显排名第一」(@annbordetsky 转发)

为什么重要

  • Eleven v4 在竞技场与发音基准双双登顶,生成速度较上代接近翻倍,并已接入 ElevenCreative、ElevenAgents 与 ElevenAPI,巩固了 ElevenLabs 在 TTS 领域的领先地位
  • 新架构带来的情绪标签、音效处理等可控生成能力,将 TTS 从单纯念稿推向「可导演」的创意制作场景
  • 但 80 美元/百万字符的定价约为谷歌竞品的 5 倍,高性能与高成本的权衡成为用户选型时的关键考量;Cartesia、Gemini、阿里 Qwen 等竞品紧随其后,差距并不悬殊

第 2 集 · 开发者实测盛赞 ElevenLabs v4:语音逼真度创新高(2026-09-29,2 条)

ElevenLabs v4 发布后,多位开发者第一时间上手体验并给出高度评价。开发者 chrisfirst 称生成语音的逼真度达到前所未有的水平,直呼「难以置信」并附上试听音频;博主 D3VAUX 试用后同样大为惊叹,称赞 ElevenLabs「这次做得很棒」,认为语音生成质量较此前大幅提升。