产业观察

ElevenLabs 推出 v4 和 v4 Turbo 语音模型:支持 90 余种语言,10 秒素材即可克隆声音

IT之家·2026/9/28 23:29:37🔗 原文

📋总体概括

ElevenLabs 于周一发布 v4 与 v4 Turbo 两款语音模型,采用全新架构,支持语言从 70 种提升至 90 余种,仅需 10 秒音频素材即可克隆声音。新版强化情绪表达控制,支持叠加多个内联标签按序执行,朗读长文本时能维持音色并记住前后语境调整语气,日语、巴西葡萄牙语、普通话和粤语提升最显著。低延迟和与大语言模型同步生成语音的特性,使其适配语音智能体场景;目前该公司超 55% 收入来自大型企业,年内曾获红杉资本 5 亿美元融资。

⚡关键信息

  • ▸ElevenLabs 推出 v4 和 v4 Turbo 两款语音模型,采用全新架构,支持 90 余种语言,较旧版的 70 种明显扩展。
  • ▸新模型仅需 10 秒音频素材即可完成声音克隆,且克隆速度更快。
  • ▸情绪标签功能升级:可叠加多个标签并按先后顺序执行,朗读长文本能维持音色、结合上下文调整语气。
  • ▸官方称日语、巴西葡萄牙语、普通话和粤语的合成质量提升最为显著。
  • ▸超过 55% 收入来自大型企业,v4 低延迟可与后端大模型同步出声,面向语音智能体与客服通话场景优化。

🔥犀利点评

10 秒克隆声音这种门槛下探,意味着语音克隆正从炫技走向量产基建,ElevenLabs 的重心明显已从创作者工具转向企业级语音智能体——55% 收入来自大客户就是最好的证明。当低延迟、可叠加情绪标签、能与 LLM 同步出声成为标配,语音赛道的比拼就不再是「像不像」,而是「稳不稳、快不快、能不能落地客服电话」。真正值得警惕的是克隆门槛越来越低,深度伪造的治理问题被行业集体装作没看见。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →