ElevenLabs v4

ElevenLabs 预告的第四代 AI 语音模型,主打能低语、能吟唱、带情绪与口音的人类级表达

深度报告

  • ElevenLabs v4 是这家伦敦与华沙背景的 AI 音频公司预告的第四代语音合成模型,目前处于「公开预览、尚未正式发布」的状态。它在 2026 年的 ElevenSummit(华沙)上由创始人 Mati Staniszewski 首次演示,主打更自然的人类级表达——能低语、能吟唱、能带情绪和口音地说出任意文本。 需要明确的是,截至 2026 年 7 月,v4 仍未开放公测,真正在线上跑的旗舰模型还是 2025 年 6 月发布的 Eleven v3。因此本报告把 v4 当作「已官宣预览的下一代方向」来写,平台现状与定价则以当前可使用的版本为准。

  • ElevenLabs 由 Mati Staniszewski 与 Piotr Dąbkowski 于 2022 年创立,技术根脉在波兰,总部设在伦敦,是欧洲最具代表性的生成式音频独角兽之一。公司起步于「让 AI 语音不再像机器」这一判断,认为通信层才是 AI 落地的瓶颈,而非单纯的「智能」本身。 几年间它从单一文本转语音工具,长成了覆盖语音生成、配音、音乐、语音克隆、实时转写与语音智能体的全栈音频平台,客户名单里既有迪士尼、Epic Games(堡垒之夜的达斯·维达语音)、Duolingo,也有德意志电信、英伟达 ACE、希腊政府旅游助手这类大型企业级部署。

  • v4 目前公开的信息来自华沙那场 keynote 的样片演示。Staniszewski 当场强调「这个模型还没发布,这是独家展示」,听众听到的是一段关于华沙的双人对话——声音能切换口音、能低语、能带情绪,甚至能吟唱。官方表述里,v4 要解决的不是「更清楚的朗读」,而是「更像人在交流」:可控的情绪、明确的意图、自然的重音与停顿。 同一场活动还预览了代号 D2 的新配音系统,它不再只依据文本生成语音,而是读取原片的情绪与表演,把这种「神韵」跨语言迁移过去,直击传统 AI 配音「表情平板」的老毛病。 对比已经在用的 Eleven v3,v3 在 2026 年 3 月 14 日全面开放,核心卖点是 Audio Tags——直接在脚本里写 [whispers]、[excited]、[sighs] 这样的行内指令,模型就会在短语级别调整演绎,无需反复重录;它还支持多说话人 Dialogue Mode、70 多种语言,单次请求上限约 3000 字符。再往下的 Multilingual v2 主打稳定一致,Flash 主打 75 毫秒极低延迟,Turbo 主打高性价比,构成了一套按「质量 / 延迟 / 成本」分工的模型矩阵。 v4 若如期落地,大概率是在 v3 的表达力之上,把「自然度」和「可控情感」再推一档。

  • ElevenLabs 的定价对同一套积分池开放,文本转语音按字符计费(高质量模型约 1 字符 = 1 积分,1 分钟音频约 1000 字符)。当前公开档位为:免费版每月 1 万积分;Starter 6 美元 / 月,3 万积分;Creator 22 美元 / 月(首月 11 美元),12.1 万积分并解锁专业语音克隆;Pro 99 美元 / 月,60 万积分、API 可输出 44.1kHz PCM;Scale 299 美元 / 月,180 万积分、3 个工作席位;Business 990 美元 / 月,600 万积分、10 席位;企业版另议。 音乐、音效、变声、配音等其它产品线从同一积分池按不同倍率扣费,例如音乐约 900 积分 / 分钟、配音约 2000–10000 积分 / 分钟。面向初创团队还有 12 个月免费、3300 万字符的资助计划。v4 的具体计费尚未公布,第三方追踪站推测约 0.30 美元 / 千字符,但属于未经证实的传闻。

  • 对现有 v3 的声音普遍是正面的。长篇有声书、游戏配音、影视本地化的从业者认可它的表现力跃升,尤其是 Audio Tags 让单人就能调度多角色情绪,省掉传统配音导演的环节。盲测偏好上,v3 相对早期 v3 Alpha 提升了 72%。 负面声音集中在两点:一是贵,按百万字符约 100 美元的价格,在批量生产场景明显贵过一众竞品;二是长文本要切分多次请求,自动化工作流略繁琐,低流量语种的质量仍不稳定。关于 v4,用户目前还停留在「期待」阶段,社区更关心它能否真正压缩机械感、以及定价会不会继续走高。

  • 在 Artificial Analysis 的语音竞技场(2026 年 6 月)里,Eleven v3 的 Elo 约 1178,稳居商业 TTS 第一梯队,但已被阿里 Fun-Realtime-TTS(约 1219)、Google Gemini 3.1 Flash TTS(约 1214)、Inworld、Cartesia Sonic 3.5 等在原始自然度上反超,而单价却远高于它们。行业共识是:ElevenLabs 胜在「生态完整 + 表达力 + 企业级合规」,但「单位成本」正成为它的软肋。 竞品方面,OpenAI TTS-1、MiniMax Speech、Cartesia、Inworld、Suno(音乐向)都在抢同一块蛋糕。

  • 声音克隆天然踩在深水区。ElevenLabs 内置了内容审核、问责与水印溯源机制,反复强调「AI 生成的音频应当可被识别」,但克隆技术被滥用于 deepfake、诈骗与冒名的风险始终存在。 商业层面,训练数据的版权与授权是绕不开的话题——公司强调音乐模型基于授权数据训练、可用于商用,但语音侧的采集来源仍不时引发讨论。对普通用户而言,真正的风险更朴素:积分贵、重跑计费、企业版条款不透明,以及 v4 这类重磅更新「官宣预览早、正式可用晚」带来的预期落差。

  • 如果你是做有声书、播客、游戏角色配音或影视本地化的内容创作者,当前直接用 v3 配合 Audio Tags 就是最务实的选择,表达力已经够用。如果你是搭建客服、销售、旅游导览这类语音智能体的企业,该看的是 ElevenAgents 与 Dubbing v2,而不是等 v4。 预算敏感、量大管饱的批量场景,建议把 ElevenLabs 和 MiniMax、Cartesia、阿里系 TTS 做一轮横向盲测再决定。至于 v4,建议把它当作「下一代方向的风向标」关注,等正式公测、拿到实测样片和定价后再下注,避免在预览阶段就为未交付的能力付费。

  • ElevenLabs v4 的方向是对的——语音交互要从「能说」走向「像人」,但它现在还只是华沙舞台上的一段预览样片。真正决定你今天要不要用的,是已经成熟的 v3 生态与那张不便宜的积分账单。

用户评论

  • 头像
    Isabella.Howard_2020
    重跑也计费这点吐槽一下,生成错了重来还扣积分,批量出片时心在滴血。

  • 头像
    RebeccaLee
    希腊政府旅游助手那个 demo 挺实在的,能识图推荐行程还能看日历,比纯聊天机器人有用多了。

  • 头像
    JosephRamirez_7
    v4 若能控情绪和意图,游戏过场动画的旁白就能一次成型,不用再后期一段段调语气了。

  • 头像
    TIram
    竞技场里 v3 已经被阿里和 Gemini 反超了,但生态是真的全,从 TTS 到配音到智能体一把梭,小团队懒得接七八家 API。

  • 头像
    SatoshiFanBennett
    开发者资助计划真香,12 个月免费 3300 万字符,我们初创直接白嫖把智能体跑通了。

  • 头像
    BobbyMorrisX48
    v4 能吟唱这点我很期待,现在做游戏 NPC 哼个小调还得另接音乐模型,要是语音模型直接能带旋律就省事了。

  • 头像
    BLkra
    整体方向我看好,语音要从「能说」走向「像人」,ElevenLabs 这步棋下得对,就看定价别飘。

  • 头像
    陈萱
    Flash 的 75 毫秒延迟做实时对话基本够用了,v4 如果还能压一压,客服场景体验会再上一个台阶。

  • 头像
    RichardRuiz_Plus
    等不及 v4 了,现在先用 v3 的 Audio Tags 做有声书,单人就能调度几个角色的情绪,省了请配音导演的钱。

  • 头像
    MadisonPatelIII
    价格再不降,真的要被 MiniMax 和阿里系抢光了。我们公司一个月光配音就烧掉几百刀,老板已经在看替代方案。

  • 头像
    Mary_ButlerSr
    又是「预览」又是「独家展示」,正式公测怕是要等到年底,建议大家别为没交付的能力提前付费。

  • 头像
    DrMar'yanZaporozhec
    盲测里 v3 比早期 Alpha 提升 72%,说明他们打磨得狠,v4 正式版应该也不会让人失望。

  • 头像
    Patrick.EdwardsII
    Music 模型基于授权数据这点很重要,商用不踩版权雷,比某些来路不明的音乐生成靠谱。

  • 头像
    Bryan.RobertsSr
    在华沙那场演示里听到 v4 的样片时,鸡皮疙瘩起来了。那种带气声的低语和自然的停顿,确实是 v3 还差一口气的感觉。

  • 头像
    goldensnake135
    配音按分钟扣积分太肉疼了,千字配音动辄上万积分,大项目还是得咬牙上 Business 档。

  • 头像
    枫叶_13
    说真的,ElevenLabs 的克隆水印和溯源做得比大部分家都认真,这点我愿意多付点钱,至少不怕哪天被牵连进 deepfake 新闻。

  • 头像
    Andrea.Ramos
    关注 v4 很久了,建议把它当风向标看,真要投产还是先用成熟的 v3 生态,别赌预览阶段。

  • 头像
    Charles.Smith_2020
    D2 配音那个跨语言保留情绪的思路对,传统 AI 配音确实像念稿机器,希望 v4 时代能真正解决「表情平板」。

  • 头像
    RRuizZ170
    能不能先把长文本单次上限从 3000 字符提上去?自动化流水线天天切分请求,烦死了。

  • 头像
    Anthony_CoxJr
    英伟达 ACE 那次合作展示的多语言营销内容生成挺惊艳,声音自然度确实行业第一梯队。

  • 头像
    Madison.Vasquez007949
    用了两年 ElevenLabs 做播客,整体很稳,就是企业版条款不透明,想加席位和并发谈得头疼。

  • 头像
    Gary32
    低流量语种质量还是参差,泰语和越南语偶尔会冒奇怪的重音,正式项目我们还是切回英文再本地化。