ElevenLabs v4
イレブンラボがプレビューした第 4 世代 AI 音声モデルは、ささやいたり、歌ったり、感情やアクセントを持つ人間レベルの表現に焦点を当てています。
詳細レポート
-
イレブンラボ v4 は、ロンドンとワルシャワに拠点を持つこの AI オーディオ会社が発表した第 4 世代の音声合成モデルです。現在は「パブリックプレビュー段階にあり、まだ正式にリリースされていない」。これは、イレブンサミット 2026 (ワルシャワ) で創設者のマティ スタニシェフスキーによって初めてデモンストレーションされ、より自然な人間レベルの表現、つまり感情とアクセントを付けてあらゆるテキストをささやき、詠唱し、話す能力に焦点を当てています。 明確にしておく必要があるのは、2026 年 7 月の時点で v4 はまだパブリック テスト用に公開されておらず、実際にオンラインで動作するフラッグシップ モデルは 2025 年 6 月にリリースされた イレブン v3 であるということです。そのため、このレポートでは v4 を「正式に発表されプレビューされた次世代の方向性」として扱います。プラットフォームの現在のステータスと価格は、現在利用可能なバージョンに基づいています。
-
2022 年に Mati Staniszewski と Piotr Dąbkowski によって設立された イレブンラボは、ポーランドに技術的なルーツを持ち、ロンドンに本社を置いています。ヨーロッパを代表するジェネレーティブ オーディオ ユニコーンの 1 つです。同社は「AIの音声はもはや機械ではない」という判断からスタートし、純粋な「知能」そのものではなく、コミュニケーション層がAI導入のボトルネックになると考えた。 数年で、単一のテキスト読み上げツールから、音声生成、吹き替え、音楽、音声クローン、リアルタイム文字起こし、音声インテリジェンスをカバーするフルスタックのオーディオ プラットフォームに成長しました。顧客リストには、ディズニー、エピック ゲームズ (フォートナイトのダース ベイダーの声)、Duolingo に加え、ドイツ テレコム、Nvidia ACE、ギリシャ政府トラベル アシスタントなどの大規模なエンタープライズ レベルの展開が含まれています。
-
v4 に関する現在の公開情報は、ワルシャワでの基調講演によるものです。スタニシェフスキー氏はその場で「このモデルはまだ発売されていない。これは独占展示だ」と強調した。聴衆が聞いたのは、ワルシャワについての二人の会話でした。その声はアクセントを切り替えたり、ささやき、感情を伝え、さらには歌うこともできます。公式声明によると、v4 が解決したいのは「より明確な読み」ではなく、「人間のコミュニケーションに近いもの」、つまり制御可能な感情、明確な意図、自然なアクセントと間です。 同じイベントでは、コード名「D2」という新しい吹き替えシステムのプレビューも行われました。もはやテキストに基づいて音声を生成するだけでなく、元の映画の感情やパフォーマンスを読み取り、この「精神」を言語を越えて転送し、従来の AI 吹き替え「表現タブレット」の古い問題を直接攻撃します。 すでに使用されている イレブン v3 と比較すると、v3 は 2026 年 3 月 14 日に完全にオープンします。中心的なセールス ポイントはオーディオ タグです。[ささやき声]、[興奮]、[ため息] などのインライン命令をスクリプトに直接書き込むと、モデルは再録音を繰り返すことなくフレーズ レベルで解釈を調整します。また、マルチスピーカーダイアログモード、70 以上の言語もサポートしており、1 回のリクエストの上限は約 3,000 文字です。さらに下位では、Multilingual v2 は安定性と一貫性を重視し、Flash は 75 ミリ秒の超低遅延を重視し、Turbo は高コストパフォーマンスを重視し、「品質/遅延/コスト」に応じて分割されたモデル マトリクスを形成しています。 v4が予定通り発売されれば、v3の表現力を上回る可能性が高く、「自然さ」や「感情のコントロール可能性」がより高いレベルに引き上げられることになる。
-
イレブンラボの価格は同じクレジットプールで設定されており、テキスト読み上げの料金は文字ごとに設定されます(高品質モデルの場合は約 1 文字 = 1 クレジット、1 分間の音声で約 1000 文字)。現在の公開レベルは次のとおりです。無料バージョンは月あたり 10,000 ポイントです。月額 6 米ドル、30,000 ポイントのスターター。クリエイターは月額 22 米ドル (最初の月は 11 米ドル)、121,000 ポイントでプロの音声クローン作成のロックを解除できます。 Pro は月額 99 ドル、600,000 ポイント、API は 44.1kHz PCM を出力できます。月額 299 米ドル、180 万ポイント、3 ワークシートのスケール。 990 USD/月、600 10,000 ポイント、10 席のビジネス。エンタープライズ版は交渉可能です。 音楽、効果音、ボイスチェンジ、吹き替えなどの他の製品ラインは、同じポイントプールから異なるレートで差し引かれます。たとえば、音楽は約900ポイント/分、ダビングは約2,000~10,000ポイント/分です。スタートアップ チーム向けに、12 か月の 3,300 万文字の無料助成プログラムもあります。 v4 の具体的な請求額はまだ発表されておらず、サードパーティの追跡サイトでは 1,000 文字あたり約 0.30 ドルであると推測されていますが、これは未確認の噂です。
-
既存の v3 のサウンドは概ね好評です。長編オーディオブック、ゲームの吹き替え、映画やテレビのローカリゼーションの実務者は、その表現力の向上を認識しています。特に、オーディオ タグを使用すると、1 人で複数のキャラクターの感情を調整できるため、従来の吹き替えディレクターの必要がなくなります。ブラインド テストの好みに関しては、v3 は初期の v3 Alpha と比較して 72% 改善されました。 否定的な声は 2 つの点に焦点を当てています。1 つは、価格が高く、100 万文字あたり約 100 ドルで、大量生産シナリオでは競合製品よりも大幅に高価です。次に、長いテキストは複数のリクエストに分割する必要があり、自動化されたワークフローはやや面倒で、トラフィックの少ない言語の品質は依然として不安定です。 v4に関しては、ユーザーはまだ「期待」の段階だ。コミュニティは、メカニカルな感触を本当に圧縮できるかどうか、そして価格が上昇し続けるかどうかのほうを懸念しています。
-
人工分析の音声分野 (2026 年 6 月) では、イレブン v3 の Elo は約 1178 で、商用 TTS の第一階層にしっかりとランクされています。ただし、素の自然さという点では Alibaba Fun-Realtime-TTS (約 1219)、Google Gemini 3.1 Flash TTS (約 1214)、Inworld、Cartesia Sonic 3.5 などに追い抜かれていますが、単価はそれらよりはるかに高いです。業界のコンセンサスは、「生態学的完全性 + 表現力 + エンタープライズレベルのコンプライアンス」では イレブンラボ社が勝っているが、「単価」が弱点になりつつあるということです。 競合製品に関しては、OpenAI TTS-1、MiniMax Speech、Cartesia、Inworld、および Suno (音楽指向) がすべて同じケーキを争っています。
-
サウンドクローンは自然に深いところまで進みます。イレブンラボは、コンテンツレビュー、アカウンタビリティ、透かし追跡メカニズムを組み込んでおり、「AIで生成された音声は識別可能であるべきだ」と繰り返し強調してきた。ただし、クローン技術がディープフェイク、詐欺、なりすましに悪用されるリスクは常に存在します。 商業レベルでは、著作権とトレーニング データの認可は避けられない話題です。同社は、音楽モデルが認可されたデータに基づいてトレーニングされており、商業目的で使用できることを強調していますが、音声側のコレクションのソースについては、依然として時々議論が引き起こされます。一般のユーザーにとって、本当のリスクはもっと単純です。高価なポイント、再実行請求、不透明なエンタープライズ バージョンの条件、そして「早期に正式に発表され、後で正式に利用可能になる」v4 などのメジャー アップデートによって生じる予想されるギャップです。
-
オーディオ ブック、ポッドキャスト、ゲーム キャラクターの吹き替え、映画やテレビのローカリゼーションを制作するコンテンツ クリエーターの場合、現時点では v3 をオーディオ タグで直接使用することが最も実用的な選択であり、表現力も十分です。カスタマー サービス、販売、旅行ガイドなどの音声対応エージェントを構築している企業の場合は、v4 を待つのではなく、イレブンエージェントとダビング v2 を検討する必要があります。 予算が厳しく、大量のバッチを完全に管理するバッチ シナリオの場合は、意思決定を行う前に、イレブンラボと MiniMax、Cartesia、および Alibaba TTS の間で水平ブラインド テストを実施することをお勧めします。 v4 については、「次世代の方向性の羽根」として注目し、プレビュー段階で提供されていない機能にお金を払わないように、公式のパブリック ベータ版を待ち、賭けをする前に実際のテスト サンプルと価格を確認することをお勧めします。
-
イレブンラボ v4 は正しい方向に進んでいます。音声インタラクションは「話せる」ものから「人間らしい」ものに移行するはずですが、これはまだワルシャワのステージでのプレビュー サンプルにすぎません。今それを使用するかどうかを決定するのは、成熟した v3 エコシステムと高額なポイント請求です。
ユーザーレビュー
-
Isabella.Howard_2020—再放送も課金されるという事実について文句を言いましょう。間違ったものが生成されて再実行された場合は減点されます。映画を一括リリースするとき、私の心は血を流します。 -
RebeccaLee—ギリシャ政府トラベルアシスタントのデモは非常に実用的です。写真を読み取ったり、旅程を推奨したり、カレンダーを表示したりできます。純粋なチャットボットよりもはるかに便利です。 -
JosephRamirez_7—v4 感情と意図を制御できれば、後で段階的にトーンを調整することなく、ゲームのカットシーンのナレーションを一度に形成できます。 -
TIram—分野では、v3 は Alibaba と Gemini に追い抜かれましたが、エコシステムは TTS から吹き替え、インテリジェント エージェントに至るまで非常に包括的であり、小規模なチームは 7 つまたは 8 つの API を受け入れるにはあまりにも怠惰です。 -
SatoshiFanBennett—開発者資金プログラムは素晴らしく、3,300 万文字が 12 か月間無料で提供されます。私たちのスタートアップは、スマート エージェントを利用するために無料でそれを使用しました。 -
BobbyMorrisX48—v4が歌えるのが楽しみです。ゲームの NPC に鼻歌を歌わせるときは、追加の音楽モデルを接続する必要があります。音声モデルが直接メロディーを伝えることができれば、より簡単になるでしょう。 -
BLkra—私は全体的な方向性については楽観的です。声は「話せる」声から「人間らしい」声へと移行します。イレブンラボがこの動きを正しく行うかどうかは、価格次第だ。 -
陈萱—Flash の 75 ミリ秒の遅延は、基本的にリアルタイム対話には十分です。 v4 がそれを抑制できれば、顧客サービス現場のエクスペリエンスは新たなレベルに引き上げられるでしょう。 -
RichardRuiz_Plus—v4 が待ちきれません。現在、v3 のオーディオ タグを使用してオーディオ ブックを作成しています。一人で複数のキャラクターの感情をコントロールできるため、吹き替えディレクターを雇う費用を節約できます。 -
MadisonPatelIII—価格が下がらなければ、MiniMaxとAlibabaは本当に製品を売り切るでしょう。私たちの会社は、わずか 1 か月でダビングに数百ドルを費やしており、上司はすでに代替案を検討しています。 -
Mary_ButlerSr—「プレビュー」と「専用表示」の両方です。公式パブリックベータ版は年末まで利用できない可能性があります。まだ提供されていない機能については、前払いしないことをお勧めします。 -
DrMar'yanZaporozhec—ブラインド テストでは、v3 は初期のアルファ版と比較して 72% 向上しました。これは、熱心に磨き上げられたことを示しており、v4 の正式バージョンも期待を裏切りません。 -
Patrick.EdwardsII—音楽モデルが承認されたデータに基づいていることが重要です。商用利用は著作権鉱山に違反せず、未知のソースから音楽を生成するよりも信頼性が高くなります。 -
Bryan.RobertsSr—ワルシャワのデモでv4のデモを聞いたときは鳥肌が立ちました。あの息づかいのようなささやきと自然な間は、まさにv3のまだ一息の感覚だ。 -
goldensnake135—アフレコで分単位で減点するのは痛すぎる。 1,000の言葉を吹き替えると、数万ポイントかかることもよくあります。大規模なプロジェクトの場合は、それでも頑張ってビジネス部門に進む必要があります。 -
枫叶_13—正直に言うと、イレブンラボはほとんどの企業よりもウォーターマークのクローン作成とトレーサビリティに真剣に取り組んでいます。私はこのためにもう少しお金を払うつもりです。少なくとも、いつかディープフェイクニュースに巻き込まれることを恐れていません。 -
Andrea.Ramos—I have been paying attention to v4 for a long time, and it is recommended to use it as a benchmark.本当に運用環境に導入したい場合は、プレビュー段階に賭けず、まず成熟した v3 エコシステムを使用する必要があります。 -
Charles.Smith_2020—D2 吹き替えには、言語を超えて感情を保持するという正しい考えがあります。従来のAI吹き替えはまさに読み上げ機のようなものです。 v4時代には「式タブレット」問題が真に解決されることを願っています。 -
RRuizZ170—まず、長いテキストの 1 つの制限を 3000 文字から増やすことはできますか?自動組立ラインではリクエストが毎日分割されるため、面倒です。 -
Anthony_CoxJr—NVIDIA ACE との連携で実証された多言語マーケティング コンテンツの生成は非常に素晴らしく、音声の自然さはまさに業界初です。 -
Madison.Vasquez007949—私は 2 年間ポッドキャストに イレブンラボを使用していますが、全体的に非常に安定しています。ただし、エンタープライズ バージョンの条件は不透明であり、シートを追加したり、同時実行性について話し合ったりするのは面倒な作業です。 -
Gary32—トラフィックの少ない言語の品質にはまだばらつきがあります。タイ語とベトナム語には時々奇妙なアクセントがあります。正式なプロジェクトの場合は、引き続き英語に戻してからローカライズします。