ElevenLabs v4
ElevenLabs 預告的第四代 AI 語音模型,主打能低語、能吟唱、帶情緒與口音的人類級表達
深度報告
-
ElevenLabs v4 是這家倫敦與華沙背景的 AI 音訊公司預告的第四代語音合成模型,目前處於「公開預覽、尚未正式釋出」的狀態。它在 2026 年的 ElevenSummit(華沙)上由創始人 Mati Staniszewski 首次演示,主打更自然的人類級表達——能低語、能吟唱、能帶情緒和口音地說出任意文字。 需要明確的是,截至 2026 年 7 月,v4 仍未開放公測,真正線上上跑的旗艦模型還是 2025 年 6 月釋出的 Eleven v3。因此本報告把 v4 當作「已官宣預覽的下一代方向」來寫,平臺現狀與定價則以當前可使用的版本為準。
-
ElevenLabs 由 Mati Staniszewski 與 Piotr Dąbkowski 於 2022 年創立,技術根脈在波蘭,總部設在倫敦,是歐洲最具代表性的生成式音訊獨角獸之一。公司起步於「讓 AI 語音不再像機器」這一判斷,認為通訊層才是 AI 落地的瓶頸,而非單純的「智慧」本身。 幾年間它從單一文字轉語音工具,長成了覆蓋語音生成、配音、音樂、語音克隆、實時轉寫與語音智慧體的全棧音訊平臺,客戶名單裡既有迪士尼、Epic Games(堡壘之夜的達斯·維達語音)、Duolingo,也有德意志電信、英偉達 ACE、希臘政府旅遊助手這類大型企業級部署。
-
v4 目前公開的資訊來自華沙那場 keynote 的樣片演示。Staniszewski 當場強調「這個模型還沒釋出,這是獨家展示」,聽眾聽到的是一段關於華沙的雙人對話——聲音能切換口音、能低語、能帶情緒,甚至能吟唱。官方表述裡,v4 要解決的不是「更清楚的朗讀」,而是「更像人在交流」:可控的情緒、明確的意圖、自然的重音與停頓。 同一場活動還預覽了代號 D2 的新配音系統,它不再只依據文字生成語音,而是讀取原片的情緒與表演,把這種「神韻」跨語言遷移過去,直擊傳統 AI 配音「表情平板」的老毛病。 對比已經在用的 Eleven v3,v3 在 2026 年 3 月 14 日全面開放,核心賣點是 Audio Tags——直接在指令碼里寫 [whispers]、[excited]、[sighs] 這樣的行內指令,模型就會在短語級別調整演繹,無需反覆重錄;它還支援多說話人 Dialogue Mode、70 多種語言,單次請求上限約 3000 字元。再往下的 Multilingual v2 主打穩定一致,Flash 主打 75 毫秒極低延遲,Turbo 主打高價效比,構成了一套按「質量 / 延遲 / 成本」分工的模型矩陣。 v4 若如期落地,大機率是在 v3 的表達力之上,把「自然度」和「可控情感」再推一檔。
-
ElevenLabs 的定價對同一套積分池開放,文字轉語音按字元計費(高質量模型約 1 字元 = 1 積分,1 分鐘音訊約 1000 字元)。當前公開檔位為:免費版每月 1 萬積分;Starter 6 美元 / 月,3 萬積分;Creator 22 美元 / 月(首月 11 美元),12.1 萬積分並解鎖專業語音克隆;Pro 99 美元 / 月,60 萬積分、API 可輸出 44.1kHz PCM;Scale 299 美元 / 月,180 萬積分、3 個工作席位;Business 990 美元 / 月,600 萬積分、10 席位;企業版另議。 音樂、音效、變聲、配音等其它產品線從同一積分池按不同倍率扣費,例如音樂約 900 積分 / 分鐘、配音約 2000–10000 積分 / 分鐘。面向初創團隊還有 12 個月免費、3300 萬字元的資助計劃。v4 的具體計費尚未公佈,第三方追蹤站推測約 0.30 美元 / 千字元,但屬於未經證實的傳聞。
-
對現有 v3 的聲音普遍是正面的。長篇有聲書、遊戲配音、影視本地化的從業者認可它的表現力躍升,尤其是 Audio Tags 讓單人就能排程多角色情緒,省掉傳統配音導演的環節。盲測偏好上,v3 相對早期 v3 Alpha 提升了 72%。 負面聲音集中在兩點:一是貴,按百萬字元約 100 美元的價格,在批次生產場景明顯貴過一眾競品;二是長文字要切分多次請求,自動化工作流略繁瑣,低流量語種的質量仍不穩定。關於 v4,使用者目前還停留在「期待」階段,社群更關心它能否真正壓縮機械感、以及定價會不會繼續走高。
-
在 Artificial Analysis 的語音競技場(2026 年 6 月)裡,Eleven v3 的 Elo 約 1178,穩居商業 TTS 第一梯隊,但已被阿里 Fun-Realtime-TTS(約 1219)、Google Gemini 3.1 Flash TTS(約 1214)、Inworld、Cartesia Sonic 3.5 等在原始自然度上反超,而單價卻遠高於它們。行業共識是:ElevenLabs 勝在「生態完整 + 表達力 + 企業級合規」,但「單位成本」正成為它的軟肋。 競品方面,OpenAI TTS-1、MiniMax Speech、Cartesia、Inworld、Suno(音樂向)都在搶同一塊蛋糕。
-
聲音克隆天然踩在深水區。ElevenLabs 內建了內容稽核、問責與水印溯源機制,反覆強調「AI 生成的音訊應當可被識別」,但克隆技術被濫用於 deepfake、詐騙與冒名的風險始終存在。 商業層面,訓練資料的版權與授權是繞不開的話題——公司強調音樂模型基於授權資料訓練、可用於商用,但語音側的採集來源仍不時引發討論。對普通使用者而言,真正的風險更樸素:積分貴、重跑計費、企業版條款不透明,以及 v4 這類重磅更新「官宣預覽早、正式可用晚」帶來的預期落差。
-
如果你是做有聲書、播客、遊戲角色配音或影視本地化的內容創作者,當前直接用 v3 配合 Audio Tags 就是最務實的選擇,表達力已經夠用。如果你是搭建客服、銷售、旅遊導覽這類語音智慧體的企業,該看的是 ElevenAgents 與 Dubbing v2,而不是等 v4。 預算敏感、量大管飽的批次場景,建議把 ElevenLabs 和 MiniMax、Cartesia、阿里系 TTS 做一輪橫向盲測再決定。至於 v4,建議把它當作「下一代方向的風向標」關注,等正式公測、拿到實測樣片和定價後再下注,避免在預覽階段就為未交付的能力付費。
-
ElevenLabs v4 的方向是對的——語音互動要從「能說」走向「像人」,但它現在還只是華沙舞臺上的一段預覽樣片。真正決定你今天要不要用的,是已經成熟的 v3 生態與那張不便宜的積分賬單。
使用者評論
-
Isabella.Howard_2020—重跑也計費這點吐槽一下,生成錯了重來還扣積分,批次出片時心在滴血。 -
RebeccaLee—希臘政府旅遊助手那個 demo 挺實在的,能識圖推薦行程還能看日曆,比純聊天機器人有用多了。 -
JosephRamirez_7—v4 若能控情緒和意圖,遊戲過場動畫的旁白就能一次成型,不用再後期一段段調語氣了。 -
TIram—競技場裡 v3 已經被阿里和 Gemini 反超了,但生態是真的全,從 TTS 到配音到智慧體一把梭,小團隊懶得接七八家 API。 -
SatoshiFanBennett—開發者資助計劃真香,12 個月免費 3300 萬字元,我們初創直接白嫖把智慧體跑通了。 -
BobbyMorrisX48—v4 能吟唱這點我很期待,現在做遊戲 NPC 哼個小調還得另接音樂模型,要是語音模型直接能帶旋律就省事了。 -
BLkra—整體方向我看好,語音要從「能說」走向「像人」,ElevenLabs 這步棋下得對,就看定價別飄。 -
陳萱—Flash 的 75 毫秒延遲做實時對話基本夠用了,v4 如果還能壓一壓,客服場景體驗會再上一個臺階。 -
RichardRuiz_Plus—等不及 v4 了,現在先用 v3 的 Audio Tags 做有聲書,單人就能排程幾個角色的情緒,省了請配音導演的錢。 -
MadisonPatelIII—價格再不降,真的要被 MiniMax 和阿里系搶光了。我們公司一個月光配音就燒掉幾百刀,老闆已經在看替代方案。 -
Mary_ButlerSr—又是「預覽」又是「獨家展示」,正式公測怕是要等到年底,建議大家別為沒交付的能力提前付費。 -
DrMar'yanZaporozhec—盲測裡 v3 比早期 Alpha 提升 72%,說明他們打磨得狠,v4 正式版應該也不會讓人失望。 -
Patrick.EdwardsII—Music 模型基於授權資料這點很重要,商用不踩版權雷,比某些來路不明的音樂生成靠譜。 -
Bryan.RobertsSr—在華沙那場演示裡聽到 v4 的樣片時,雞皮疙瘩起來了。那種帶氣聲的低語和自然的停頓,確實是 v3 還差一口氣的感覺。 -
goldensnake135—配音按分鐘扣積分太肉疼了,千字配音動輒上萬積分,大專案還是得咬牙上 Business 檔。 -
楓葉_13—說真的,ElevenLabs 的克隆水印和溯源做得比大部分家都認真,這點我願意多付點錢,至少不怕哪天被牽連進 deepfake 新聞。 -
Andrea.Ramos—關注 v4 很久了,建議把它當風向標看,真要投產還是先用成熟的 v3 生態,別賭預覽階段。 -
Charles.Smith_2020—D2 配音那個跨語言保留情緒的思路對,傳統 AI 配音確實像念稿機器,希望 v4 時代能真正解決「表情平板」。 -
RRuizZ170—能不能先把長文字單次上限從 3000 字元提上去?自動化流水線天天切分請求,煩死了。 -
Anthony_CoxJr—英偉達 ACE 那次合作展示的多語言營銷內容生成挺驚豔,聲音自然度確實行業第一梯隊。 -
Madison.Vasquez007949—用了兩年 ElevenLabs 做播客,整體很穩,就是企業版條款不透明,想加席位和併發談得頭疼。 -
Gary32—低流量語種質量還是參差,泰語和越南語偶爾會冒奇怪的重音,正式專案我們還是切回英文再本地化。