The Decoder 报道,ElevenLabs 正在发布语音模型 Eleven v4。公司称,它更准确地跟随方向提示,并在长篇制作里保持声音一致。一套新的模型架构同时驱动面向实时语音智能体的 Turbo 版本。相对前代,v4 更可靠地生成笑声、耳语,以及摔门这类声音。面向语音智能体的 Turbo 大约在 150 毫秒时开始出声。一年多前发布的 Eleven v3 已经支持这些音频标签,但执行得没那么准。
[1]
ElevenLabs 说,v4 用新架构分析脚本的语气、节奏和上下文。用户可以用标签或普通句子下指令,也可以用音标拼写指定人名和技术术语的读法。公司称,发音控制现在更可靠。叙述者和角色应当在整部作品里保持一致,即使用户把某一句重新生成好几次。单次请求最多 1 万个字符,大约十分钟音频。有声书这类更长的作品要分成多段,节奏和表达应当跨段保持。对白里,说话的一方会响应整场戏的上下文,而不是把每一句孤立地说完。新版本支持 90 多种语言,v3 大约是 70 种。克隆声音说其他语言时应当带当地口音,而不是随时间漂回原来的口音。专业语音克隆在 v3 里不可用,这次恢复;即时语音克隆只需要十秒音频。
[1]Turbo 面向客服电话或游戏角色这类实时用途。公司说,做语音智能体的人以前得在速度和表现力之间选一个,v4 Turbo 是要两者都给。在 ElevenLabs 自己的测试里,Turbo 在 150 毫秒开始发出可听见的语音,Cartesia Sonic 3.6 是 262 毫秒,OpenAI 的 GPT-4o mini TTS 是 814 毫秒。公司说,Turbo 是和 ElevenAgents 平台一起优化的。这些是公司的测试,不是本篇复测。The Decoder 还写,Eleven v4 在 Artificial Analysis 的 Provider Voice Arena 榜上排在 Cartesia Sonic 3.6 和 Google 的 Gemini 3.8 Flash TTS 前面。发音基准得分 91.7%,v3 是 85.6%。在 ElevenLabs 的盲测里,大约四分之三的听众更喜欢 v4,对照是 Cartesia、Inworld 和 Google。公司盲测里,听众在 65% 到 81% 的比较中认为 v4 更有表现力,比例随对照对象变化。
[1]更高质量的克隆被公司用来说明配音用途:可以把一名演员的声音用到所有支持的语言里。公司向声音的权利人取得授权。配音演员可以把经过大量训练的克隆放进 ElevenLabs 的声音库,付费用户使用时他们获得收入。公司已经通过专门的市场提供名人声音,例如 Michael Caine。两个模型上市时都有临时降价。标准 API 价格是 v4 每百万字符 80 美元,Turbo 40 美元。到 10 月 12 日,这两个价格降到 22 美元和 11 美元。按 ElevenLabs 的说法,每月 22 美元的 Creator 方案及以上用户,可以在两周内于 ElevenCreative 里使用 v4,不另收费,用量上限是月度额度的两倍。Artificial Analysis 列出 Sonic 3.6 为每百万字符 49 美元,Gemini 3.8 Flash TTS 为 16.49 美元。两个模型现在可在 ElevenAgents、ElevenCreative 和 API 里使用。文档称,客户数据默认存在美国。企业客户可以放在欧盟、印度或新加坡的隔离环境里,但部分处理仍可能发生在所选区域之外。在欧盟,客户可以用一种不保留数据的模式,把 API 处理留在区域内。
[1]要点
- ElevenLabs 称 v4 更听方向提示,长篇里声音更一致;单次最多约 1 万字符。
- 语种从大约 70 种增到 90 种以上。专业语音克隆恢复,即时克隆需要十秒音频。
- 公司测试里 Turbo 150 毫秒出声,对照是 Sonic 3.6 的 262 毫秒和 GPT-4o mini TTS 的 814 毫秒。
- API 标价每百万字符 80 与 40 美元,10 月 12 日前为 22 与 11 美元。数据默认存在美国。