ElevenLabs v4

ElevenLabs 预告的第四代 AI 语音模型,主打能低语、能吟唱、带情绪与口音的人类级表达

詳細レポート

  • イレブンラボ v4 は、ロンドンとワルシャワに拠点を持つこの AI オーディオ会社が発表した第 4 世代の音声合成モデルです。現在は「パブリックプレビュー段階にあり、まだ正式にリリースされていない」。これは、イレブンサミット 2026 (ワルシャワ) で創設者のマティ スタニシェフスキーによって初めてデモンストレーションされ、より自然な人間レベルの表現、つまり感情とアクセントを付けてあらゆるテキストをささやき、詠唱し、話す能力に焦点を当てています。 明確にしておく必要があるのは、2026 年 7 月の時点で v4 はまだパブリック テスト用に公開されておらず、実際にオンラインで動作するフラッグシップ モデルは 2025 年 6 月にリリースされた イレブン v3 であるということです。そのため、このレポートでは v4 を「正式に発表されプレビューされた次世代の方向性」として扱います。プラットフォームの現在のステータスと価格は、現在利用可能なバージョンに基づいています。

  • 2022 年に Mati Staniszewski と Piotr Dąbkowski によって設立された イレブンラボは、ポーランドに技術的なルーツを持ち、ロンドンに本社を置いています。ヨーロッパを代表するジェネレーティブ オーディオ ユニコーンの 1 つです。同社は「AIの音声はもはや機械ではない」という判断からスタートし、純粋な「知能」そのものではなく、コミュニケーション層がAI導入のボトルネックになると考えた。 数年で、単一のテキスト読み上げツールから、音声生成、吹き替え、音楽、音声クローン、リアルタイム文字起こし、音声インテリジェンスをカバーするフルスタックのオーディオ プラットフォームに成長しました。顧客リストには、ディズニー、エピック ゲームズ (フォートナイトのダース ベイダーの声)、Duolingo に加え、ドイツ テレコム、Nvidia ACE、ギリシャ政府トラベル アシスタントなどの大規模なエンタープライズ レベルの展開が含まれています。

  • v4 に関する現在の公開情報は、ワルシャワでの基調講演によるものです。スタニシェフスキー氏はその場で「このモデルはまだ発売されていない。これは独占展示だ」と強調した。聴衆が聞いたのは、ワルシャワについての二人の会話でした。その声はアクセントを切り替えたり、ささやき、感情を伝え、さらには歌うこともできます。公式声明によると、v4 が解決したいのは「より明確な読み」ではなく、「人間のコミュニケーションに近いもの」、つまり制御可能な感情、明確な意図、自然なアクセントと間です。 同じイベントでは、コード名「D2」という新しい吹き替えシステムのプレビューも行われました。もはやテキストに基づいて音声を生成するだけでなく、元の映画の感情やパフォーマンスを読み取り、この「精神」を言語を越えて転送し、従来の AI 吹き替え「表現タブレット」の古い問題を直接攻撃します。 すでに使用されている イレブン v3 と比較すると、v3 は 2026 年 3 月 14 日に完全にオープンします。中心的なセールス ポイントはオーディオ タグです。[ささやき声]、[興奮]、[ため息] などのインライン命令をスクリプトに直接書き込むと、モデルは再録音を繰り返すことなくフレーズ レベルで解釈を調整します。また、マルチスピーカーダイアログモード、70 以上の言語もサポートしており、1 回のリクエストの上限は約 3,000 文字です。さらに下位では、Multilingual v2 は安定性と一貫性を重視し、Flash は 75 ミリ秒の超低遅延を重視し、Turbo は高コストパフォーマンスを重視し、「品質/遅延/コスト」に応じて分割されたモデル マトリクスを形成しています。 v4が予定通り発売されれば、v3の表現力を上回る可能性が高く、「自然さ」や「感情のコントロール可能性」がより高いレベルに引き上げられることになる。

  • イレブンラボの価格は同じクレジットプールで設定されており、テキスト読み上げの料金は文字ごとに設定されます(高品質モデルの場合は約 1 文字 = 1 クレジット、1 分間の音声で約 1000 文字)。現在の公開レベルは次のとおりです。無料バージョンは月あたり 10,000 ポイントです。月額 6 米ドル、30,000 ポイントのスターター。クリエイターは月額 22 米ドル (最初の月は 11 米ドル)、121,000 ポイントでプロの音声クローン作成のロックを解除できます。 Pro は月額 99 ドル、600,000 ポイント、API は 44.1kHz PCM を出力できます。月額 299 米ドル、180 万ポイント、3 ワークシートのスケール。 990 USD/月、600 10,000 ポイント、10 席のビジネス。エンタープライズ版は交渉可能です。 音楽、効果音、ボイスチェンジ、吹き替えなどの他の製品ラインは、同じポイントプールから異なるレートで差し引かれます。たとえば、音楽は約900ポイント/分、ダビングは約2,000~10,000ポイント/分です。スタートアップ チーム向けに、12 か月の 3,300 万文字の無料助成プログラムもあります。 v4 の具体的な請求額はまだ発表されておらず、サードパーティの追跡サイトでは 1,000 文字あたり約 0.30 ドルであると推測されていますが、これは未確認の噂です。

  • 既存の v3 のサウンドは概ね好評です。長編オーディオブック、ゲームの吹き替え、映画やテレビのローカリゼーションの実務者は、その表現力の向上を認識しています。特に、オーディオ タグを使用すると、1 人で複数のキャラクターの感情を調整できるため、従来の吹き替えディレクターの必要がなくなります。ブラインド テストの好みに関しては、v3 は初期の v3 Alpha と比較して 72% 改善されました。 否定的な声は 2 つの点に焦点を当てています。1 つは、価格が高く、100 万文字あたり約 100 ドルで、大量生産シナリオでは競合製品よりも大幅に高価です。次に、長いテキストは複数のリクエストに分割する必要があり、自動化されたワークフローはやや面倒で、トラフィックの少ない言語の品質は依然として不安定です。 v4に関しては、ユーザーはまだ「期待」の段階だ。コミュニティは、メカニカルな感触を本当に圧縮できるかどうか、そして価格が上昇し続けるかどうかのほうを懸念しています。

  • 人工分析の音声分野 (2026 年 6 月) では、イレブン v3 の Elo は約 1178 で、商用 TTS の第一階層にしっかりとランクされています。ただし、素の自然さという点では Alibaba Fun-Realtime-TTS (約 1219)、Google Gemini 3.1 Flash TTS (約 1214)、Inworld、Cartesia Sonic 3.5 などに追い抜かれていますが、単価はそれらよりはるかに高いです。業界のコンセンサスは、「生態学的完全性 + 表現力 + エンタープライズレベルのコンプライアンス」では イレブンラボ社が勝っているが、「単価」が弱点になりつつあるということです。 競合製品に関しては、OpenAI TTS-1、MiniMax Speech、Cartesia、Inworld、および Suno (音楽指向) がすべて同じケーキを争っています。

  • サウンドクローンは自然に深いところまで進みます。イレブンラボは、コンテンツレビュー、アカウンタビリティ、透かし追跡メカニズムを組み込んでおり、「AIで生成された音声は識別可能であるべきだ」と繰り返し強調してきた。ただし、クローン技術がディープフェイク、詐欺、なりすましに悪用されるリスクは常に存在します。 商業レベルでは、著作権とトレーニング データの認可は避けられない話題です。同社は、音楽モデルが認可されたデータに基づいてトレーニングされており、商業目的で使用できることを強調していますが、音声側のコレクションのソースについては、依然として時々議論が引き起こされます。一般のユーザーにとって、本当のリスクはもっと単純です。高価なポイント、再実行請求、不透明なエンタープライズ バージョンの条件、そして「早期に正式に発表され、後で正式に利用可能になる」v4 などのメジャー アップデートによって生じる予想されるギャップです。

  • オーディオ ブック、ポッドキャスト、ゲーム キャラクターの吹き替え、映画やテレビのローカリゼーションを制作するコンテンツ クリエーターの場合、現時点では v3 をオーディオ タグで直接使用することが最も実用的な選択であり、表現力も十分です。カスタマー サービス、販売、旅行ガイドなどの音声対応エージェントを構築している企業の場合は、v4 を待つのではなく、イレブンエージェントとダビング v2 を検討する必要があります。 予算が厳しく、大量のバッチを完全に管理するバッチ シナリオの場合は、意思決定を行う前に、イレブンラボと MiniMax、Cartesia、および Alibaba TTS の間で水平ブラインド テストを実施することをお勧めします。 v4 については、「次世代の方向性の羽根」として注目し、プレビュー段階で提供されていない機能にお金を払わないように、公式のパブリック ベータ版を待ち、賭けをする前に実際のテスト サンプルと価格を確認することをお勧めします。

  • イレブンラボ v4 は正しい方向に進んでいます。音声インタラクションは「話せる」ものから「人間らしい」ものに移行するはずですが、これはまだワルシャワのステージでのプレビュー サンプルにすぎません。今それを使用するかどうかを決定するのは、成熟した v3 エコシステムと高額なポイント請求です。

ユーザーレビュー

  • 头像
    Isabella.Howard_2020
    重跑也计费这点吐槽一下,生成错了重来还扣积分,批量出片时心在滴血。

  • 头像
    RebeccaLee
    希腊政府旅游助手那个 demo 挺实在的,能识图推荐行程还能看日历,比纯聊天机器人有用多了。

  • 头像
    JosephRamirez_7
    v4 若能控情绪和意图,游戏过场动画的旁白就能一次成型,不用再后期一段段调语气了。

  • 头像
    TIram
    竞技场里 v3 已经被阿里和 Gemini 反超了,但生态是真的全,从 TTS 到配音到智能体一把梭,小团队懒得接七八家 API。

  • 头像
    SatoshiFanBennett
    开发者资助计划真香,12 个月免费 3300 万字符,我们初创直接白嫖把智能体跑通了。

  • 头像
    BobbyMorrisX48
    v4 能吟唱这点我很期待,现在做游戏 NPC 哼个小调还得另接音乐模型,要是语音模型直接能带旋律就省事了。

  • 头像
    BLkra
    整体方向我看好,语音要从「能说」走向「像人」,ElevenLabs 这步棋下得对,就看定价别飘。

  • 头像
    陈萱
    Flash 的 75 毫秒延迟做实时对话基本够用了,v4 如果还能压一压,客服场景体验会再上一个台阶。

  • 头像
    RichardRuiz_Plus
    等不及 v4 了,现在先用 v3 的 Audio Tags 做有声书,单人就能调度几个角色的情绪,省了请配音导演的钱。

  • 头像
    MadisonPatelIII
    价格再不降,真的要被 MiniMax 和阿里系抢光了。我们公司一个月光配音就烧掉几百刀,老板已经在看替代方案。

  • 头像
    Mary_ButlerSr
    又是「预览」又是「独家展示」,正式公测怕是要等到年底,建议大家别为没交付的能力提前付费。

  • 头像
    DrMar'yanZaporozhec
    盲测里 v3 比早期 Alpha 提升 72%,说明他们打磨得狠,v4 正式版应该也不会让人失望。

  • 头像
    Patrick.EdwardsII
    Music 模型基于授权数据这点很重要,商用不踩版权雷,比某些来路不明的音乐生成靠谱。

  • 头像
    Bryan.RobertsSr
    在华沙那场演示里听到 v4 的样片时,鸡皮疙瘩起来了。那种带气声的低语和自然的停顿,确实是 v3 还差一口气的感觉。

  • 头像
    goldensnake135
    配音按分钟扣积分太肉疼了,千字配音动辄上万积分,大项目还是得咬牙上 Business 档。

  • 头像
    枫叶_13
    说真的,ElevenLabs 的克隆水印和溯源做得比大部分家都认真,这点我愿意多付点钱,至少不怕哪天被牵连进 deepfake 新闻。

  • 头像
    Andrea.Ramos
    关注 v4 很久了,建议把它当风向标看,真要投产还是先用成熟的 v3 生态,别赌预览阶段。

  • 头像
    Charles.Smith_2020
    D2 配音那个跨语言保留情绪的思路对,传统 AI 配音确实像念稿机器,希望 v4 时代能真正解决「表情平板」。

  • 头像
    RRuizZ170
    能不能先把长文本单次上限从 3000 字符提上去?自动化流水线天天切分请求,烦死了。

  • 头像
    Anthony_CoxJr
    英伟达 ACE 那次合作展示的多语言营销内容生成挺惊艳,声音自然度确实行业第一梯队。

  • 头像
    Madison.Vasquez007949
    用了两年 ElevenLabs 做播客,整体很稳,就是企业版条款不透明,想加席位和并发谈得头疼。

  • 头像
    Gary32
    低流量语种质量还是参差,泰语和越南语偶尔会冒奇怪的重音,正式项目我们还是切回英文再本地化。