ElevenLabs v4登顶TTS榜,超过Gemini和Qwen

BiRun 讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。

在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。

v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。

Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。

信源

动察 Beating 频道 · 动察 Beating 交流群。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯