模型#文本转语音#声音克隆

ElevenLabs 发布 v4 与 v4 Turbo:90+ 语言、10 秒克隆,Turbo 延迟约 100 毫秒

ElevenLabs 9 月 28 日发布语音模型 v4 与 v4 Turbo:90+ 语言、10 秒克隆声音,Turbo 延迟约 100 毫秒,开放 API。

ElevenLabs v4 发布主视觉:橙绿渐变上的 Eleven V4 标识

ElevenLabs 9 月 28 日正式发布语音模型 v4 与 v4 Turbo,两款都已通过应用与 API 开放使用,不是预览版。v4 把语言覆盖从 v3 的 70 种提到 90 种以上,支持约 10 秒音频克隆声音、恢复专业声音克隆(v3 缺失的功能),并引入可叠加的内联情感标签——[laughs]、[whispers]、[pause] 会在序列里依次生效。v4 Turbo 面向语音智能体场景,官方称中位推理延迟约 100 毫秒。

事实部分

  • v4:90+ 语言(v3 为 70);约 10 秒音频即可克隆声音;恢复 Professional Voice Clones;支持可叠加的内联表情标签,按序列执行。
  • v4 Turbo:定位语音智能体,官方页面给出的对比为中位推理延迟约 100 毫秒、首语音前延迟约 150 毫秒;对比对象为 Cartesia Sonic 3.6(262 毫秒)与 OpenAI GPT-4o mini TTS(814 毫秒)——均为 ElevenLabs 自测口径。
  • 可用性:应用、API(模型名 eleven_v4)与 ElevenAgents 即日起可用;免费档每月 10,000 积分(约 10 分钟音频),付费档每月 6 美元起。
  • 背景:两款模型年初在华沙活动上预告过;TechCrunch 报道还提到其融资传闻(年初 5 亿美元、估值 110 亿美元)与年收入运行率从 3.3 亿升至 6 亿美元以上,属媒体报道口径。

编辑判断

这轮发布的重点与其说是音质,不如说是延迟和工程性:内联情感标签让「哪里笑、哪里停」变成可版本控制的标记,Turbo 的百毫秒档直接对准语音智能体的对话体验。做配音、有声书或语音机器人的团队值得直接上手对比——和开源的 YoVoice 这类本地工具比,它省掉部署但按量付费。要注意官方延迟对比是自家测试口径,接入前用自己的话术实测一轮再定。