HappyHorse

AlibabaのオープンソースAIビデオジェネレーター

詳細レポート

  • HappyHorse 1.0 は、Alibaba ATH (Alibaba Token Hub) イノベーション部門が立ち上げたオープンソースの AI 動画生成モデルです。 2026 年 4 月初旬、世界的に権威のある AI 評価プラットフォームである Artificial Analysis の Video Arena ランキングに登場しました。デビュー当時、テキスト生成ビデオとイメージ生成ビデオの 2 つの主要な評価で 1357 ~ 1406 ポイントという高い ELO スコアで 1 位を獲得し、オープンソース ビデオ生成の分野における画期的な製品となりました。このモデルは、元Kuaishou副社長のZhang Di氏が率いるチームによって開発されました。その中心的な利点は、150 億パラメータの統一アーキテクチャ下でのネイティブ オーディオおよびビデオ同期生成機能にあります。 7ヶ国語での正確なリップシンクをサポートします。まだ内部テスト段階にあり、公開テストにはまだ完全に公開されていません。

  • HappyHorse 1.0 は、Alibaba Taotian Group に関連する Alibaba ATH イノベーション部門の Future Life Lab によって開発されました。プロジェクトリーダーは、以前Kuaishouの副社長およびKling AIのテクニカルディレクターを務めたZhang Di氏です。彼はビデオ生成分野において深い技術的蓄積と業界知識を持っています。 2026 年 3 月 16 日、アリババは、CEO 呉永明が直接責任を負い、次世代 AI コンテンツ作成プラットフォームとして位置付けられる Alibaba Token Hub (ATH) ビジネス グループを正式に設立しました。 HappyHorse は、このビジネス グループの最初の探査結果の 1 つです。 ATH AI イノベーション部門は、AI 時代のインタラクティブ手法の探索計画を立ち上げており、今後さらに多くの製品が発売される予定です。 技術協力のレベルでは、HappyHorse は Sand.ai (自己回帰世界モデル) と上海知能計算研究所の GAIR 研究室によってサポートされています。このモデルは、2026 年 3 月にオープンソース化された daVinci-MagiHuman プロジェクトに基づいて進化しましたが、アーキテクチャとパフォーマンスの大規模なアップグレードが行われ、最終的に今日の 150 億パラメータの統合されたマルチモーダル大規模モデルが形成されました。

  • HappyHorse のリリースは、AI ビデオ生成トラックにおける熾烈な競争の時期と一致しています。 2026年以降、OpenAIのSora 2、ByteDanceのSeedance 2.0、KuaishouのKling 3.0、GoogleのVeo 3といった主要製品が相次いで発売されている。ビデオ生成は、AI 分野で最も注目されている方向の 1 つになりつつあります。この時点でHappyHorseは空挺的にランキングトップに直接浮上した。記者会見や事前マーケティングは行われなかった。純粋に技術力に頼って業界に衝撃を与えたのは、アリババのAIビデオ分野での深い蓄積と、突然力を発揮するという戦略的意図を反映していた。

  • HappyHorse 1.0 は、150 億のパラメータと合計 40 のセルフ アテンション レイヤーを備えた統合シングルストリーム Transformer アーキテクチャを採用しています。このアーキテクチャの中核となる革新は、統一されたマルチモーダル設計にあります。テキスト トークン、画像潜在変数、ビデオ フレーム、およびオーディオ波形が、クロス アテンション モジュールや外部オーディオ モデルを必要とせずに、共同ノイズ除去用のシーケンスにパッケージ化されます。中間の 32 のレイヤーはすべてのモダリティ間でパラメーターを共有し、最初と最後の 4 つのレイヤーはモダリティ固有の投影を使用して、真に統合されたオーディオとビデオの生成を実現します。 このモデルは DMD-2 蒸留テクノロジーを適用し、ノイズ除去ステップを従来の数十ステップからわずか 8 ステップに削減し、推論効率を大幅に向上させます。 NVIDIA H100 シングル カードでは、256p プレビュー モードでは 5 秒のビデオを約 2 秒で生成でき、同期オーディオを備えた 1080p のフル バージョンでは 5 秒のビデオを約 38 秒で生成できます。

  • 生成機能の点では、HappyHorse はテキスト生成ビデオ、画像生成ビデオ、マルチカメラ ナラティブ、およびシーン間のキャラクターの一貫性をサポートしています。ユーザーは、カメラの動き、照明条件、キャラクターのアクションなどを含む単純なテキスト記述を通じて複雑なシーンを生成できます。静止画像の場合、モデルは被写体の一貫性を維持しながら動的なビデオに変換できます。 ネイティブ オーディオとビデオの同期生成は、このモデルの核となるハイライトです。ビデオとオーディオは、後からダビングするのではなく、単一の生成プロセスで同期されます。このモデルは、中国語、広東語、英語、日本語、韓国語、ドイツ語、フランス語を含む 7 つの言語での正確なリップシンクをサポートしており、WER ワード エラー率は極めて低くなります。これにより、AI ビデオの分野における長年の問題点である、サイレントビデオや音声とビデオの同期がずれている問題が解決されます。 出力仕様としては、16:9、9:16、4:3、3:4、21:9、1:1の複数のアスペクト比をサポートしています。 5 ~ 12 秒のビデオを生成するたびに、最大 1080p の解像度をサポートし、2K にアップグレードできます。商用利用の場合、各ビデオは 100% の商用著作権を享受します。

  • 公式サイトによると、世界中で1万人以上のクリエイターがHappyHorse 1.0を利用しているという。ユーザーのフィードバックから判断すると、マルチカメラのナレーション機能は破壊的であると考えられており、ネイティブ オーディオの生成はユーザーに衝撃を与えています。 2K映画レベルの画質はプロの制作基準に達しており、生成速度は同様のツールよりも約30%高速です。新規ユーザーは、クレジット カードを拘束せずにすべての機能を体験できるポイントを無料で入手できます。

  • HappyHorse は 3 つのレベルのサブスクリプション パッケージを提供しています。基本バージョンの料金は月額 11.90 ドルで、540 ポイントを提供し、約 54 個のビデオを生成できます。プロフェッショナル バージョンの料金は月額 39.90 ドルで、2,040 ポイントが付与され、頻繁に作成するクリエイターに適しています。スタジオ バージョンの料金は月額 99.99 ドルで、6,000 ポイントが提供され、高強度の商用利用がサポートされています。ポイントは毎月リセットされ、貯めることはできません。 HappyHorse はオープンソース製品として、基本モデル、蒸留モデル、超解像度モジュール、推論コードを含む完全なオープンソース バージョンを提供します。ユーザーは完全にセルフホストしてローカルで実行できるため、プライバシー要件や詳細なカスタマイズが必要な商用ユーザーにとっては魅力的です。

  • 公開情報から判断すると、HappyHorse に対するユーザーのフィードバックは概して好意的です。肯定的なコメントは主にいくつかの側面に集中しています。ネイティブ オーディオとビデオの同時生成は業界の画期的な進歩と考えられており、画像とポストダビングしか生成できない AI ビデオの過去の制限を解決します。マルチレンズナラティブ機能は、クリエイターに認められた複雑なストーリーシーンの生成をサポートします。生成速度と画質はほとんどの競合製品よりも優れています。完全にオープンソースの商用モデルにより、クリエイターの使用コストが削減されます。 テクノロジー コミュニティは、HappyHorse のアーキテクチャ上の革新に大きな注目を集めています。 150 億のパラメータを備えた統合シングルストリーム Transformer 設計は、パフォーマンスを確保しながら真のオーディオとビデオの統合を実現し、ビデオ生成の分野における重要な技術的進歩と考えられています。

  • Artificial Analysis Video Arena の最新の評価では、HappyHorse 1.0 は印象的な結果を達成しました。音声なしのテキスト生成ビデオが Elo スコア 1333 ~ 1357 で 1 位にランクされ、2 位の Seedance 2.0 を約 60 ポイント上回りました。画像生成ビデオは 1391 ~ 1406 ポイントでプラットフォームの歴史の最高記録を樹立しました。音声付きモードでも安定して2位を維持した。この成果により、これは世界で最も強力なオープンソース AI ビデオ生成モデルになります。 クローズドソースの競合他社と比較して、HappyHorse はオープンソースのエコロジーとセルフホスティング機能において独自の利点を持っています。 Seedance 2.0、Kling 3.0、Veo 3 などのクローズド ソース モデルと比較すると、その主な違いは、完全にオープン ソースであり、ローカルに展開でき、ネイティブのオーディオとビデオの同期が可能なアーキテクチャ設計にあります。

  • メディアの報道では通常、HappyHorse のリリースについてダークホース、トップセラー、破壊的などの言葉が使われています。 Caijing、36kr、Aifaner、Geek Parkなどの中国のテクノロジーメディアがこの件を報じている。業界関係者らは、ビデオ生成における競争は始まったばかりであり、HappyHorseは新たな章の最初のページを開いたばかりであり、AIビデオトラックにおける競争がまだ終わっていないことを示唆しているとコメントした。 2026 年 4 月 30 日に、HappyHorse は API を正式にオープンし、商用運用の新たな段階に入ります。外部の世界は一般に、その API の価格設定とオープン性について懸念しており、これは同社の商業化戦略を判断するための重要な窓口となるでしょう。

  • 現在、HappyHorse はまだ内部テストの段階にあり、大規模には導入されていません。 IT House のレポートによると、インターネット上で流通している公式 Web サイトのアドレスの多くは正式に認定されたバージョンではなく、正式な製品がすべての人に提供されるまでまだ待つ必要があります。初期のユーザーは、不安定な機能や長いキュー時間などの問題に直面する可能性があります。

  • オープンソース版も提供されていますが、オープンソースと商用化のバランスが課題です。オープンソース バージョンの機能が高すぎる場合、有料サブスクリプションの収益に影響を与える可能性があります。オープンソース バージョン間のパフォーマンスの差が大きすぎる場合、開発者コミュニティの参加に影響を与える可能性があります。オープンソースのエコロジーと商業的な収益化の間のバランスをどのように見つけるかは、HappyHorse が直面する長期的な課題です。

  • AI動画生成技術はディープフェイクに悪用される潜在的なリスクを抱えている。生成の質が向上するにつれて、偽の有名人や偽のニュースなどのシナリオでテクノロジーが使用されるのを防ぐ方法には、プラットフォーム、規制当局、ユーザーによる共同の取り組みが必要です。

  • HappyHorse は、以下のユーザーに特に適しています。プロのビデオ クリエーターやショート ビデオの専門家、製品プロモーション、ソーシャル メディアのショート フィルム、コンセプト プレビューや短いナラティブ ビデオを迅速に作成する必要があるコンテンツ クリエーター、オープンソースのセルフホスティング機能を優先するエンタープライズ ユーザー、オーディオとビデオの同期品質と多言語のリップ シンクに対する高い要件を持つプロジェクト、ビデオ生成テクノロジを研究および学習する開発者や研究者です。

  • 予算が非常に限られており、品質要件が低い単純なシナリオの場合、有料バージョンは無料ツールほど費用対効果が高くない可能性があります。 12 秒を超える長いビデオを必要とするプロジェクトの場合、現在のバージョンではニーズを満たせない可能性があります。特定のブランドやキャラクターを表示する必要がある商業広告の場合は、コンプライアンス要件に注意を払う必要があります。

  • クローズドソース ソリューションでは、Seedance 2.0 ByteDance、Kling 3.0 Kuaishou、および Veo 3 Google が主な競合製品です。オープンソース ソリューションの中で、Wan 2.6 などは参考の選択肢として使用できますが、全体的なパフォーマンスと HappyHorse の間にはギャップがあります。

  • HappyHorse 1.0 は、AI ビデオ生成の分野における Alibaba の大ヒット製品です。 150 億パラメータの統一アーキテクチャの下でのネイティブのオーディオおよびビデオ同期生成機能は、技術レベルで明確な最先端を持っています。デビューと同時に世界的な権威あるレビューでトップを獲得し、その技術力の高さを証明しました。完全なオープンソース製品として、コンテンツ作成者に新しいオプションを提供し、特にローカル展開や詳細なカスタマイズを必要とするユーザーにとって魅力的です。 この製品は現在まだ内部テスト段階にあり、API は 2026 年 4 月 30 日に正式に公開される予定です。その時点で、その商品化戦略と API の価格設定が業界の焦点となるでしょう。 AIビデオ生成トラックにおける競争は熾烈です。 HappyHorse が公開テストと商品化後も技術的リーダーシップを維持できるかどうかは、さらなる観察が必要です。

ユーザーレビュー

  • 头像
    happyfrog634
    APIの正式公開が楽しみですが、まだグレースケールです。バッチで実行したい場合は、毎回列に並んでスポットを待つ必要があります。

  • 头像
    Lauren190
    Kling 3.0 は、複雑な流体や長いクレーン追跡ショットに対してより安定しています。 HappyHorse は、対話主導型、多言語リップシンク、電子商取引ファブリック テクスチャなどのシナリオに非常に強力です。 9枚の参照画像による入力文字制御は非常に安定しています。つまり、苦手なことに使うのではなく、適切なシーンを見つけて費用対効果を最大化しましょう。

  • 头像
    AnnHoward_X
    リップシンクは正確ですが、4 行の短い会話を 15 秒に詰め込むのは少しきついです。音楽シーンでは、楽器の音と手がずれてしまうことがあります。将来的に修正されることを願っています。

  • 头像
    Gabriel_Anderson04
    バージョン1.1では肌の質感がよりリアルになり、毛穴や小じわが表現され、デジタル特有の光沢感がなくなりました。

  • 头像
    DebbieWard
    価格を比較したところ、HappyHorse公式サイトの割引価格は720Pでわずか0.44元/秒、1080Pで0.78元、Seedance 2.0は1元で2.48元となっています。中小規模のチームの場合、この差は積み重なるとかなりの金額になる可能性があります。企業顧客が Alibaba Cloud API を使用するためのしきい値はありません。バイトは数千万元を前払いしなければならない。アリババのこの波は、積極的に顧客を引き抜いている。

  • 头像
    VMillerX
    GitHubで軽量化できると言っているのを見て逃げましたが、それは嘘でした。政府関係者は長い間、クローズドソースには重みがないと述べてきたので、皆さんには騙されないように注意していただきたいと思います。

  • 头像
    Samantha.Lewis_2024
    列はシーダンスよりもはるかに快適で、待ち時間はほとんどありませんでした。

  • 头像
    Alexander.GonzalesX
    正直に言うと、コマーシャルやショートドラマの「ミドルショット」(キャラクターの感情、生活シーン、Bロールの空ショット、トランジションなど)に最適です。以前は屋外撮影、モデル、ロケーションに頼っていましたが、今では即時と数ドルで解決できます。しかし、監督の後任としてそれに頼るのはまだ早い。物理、オーディオ、長期的な一貫性には限界があります。

  • 头像
    Jessica.Kim_Plus854
    スキンケア商品の縦画面広告がすごい。ボトルの金色の文字は鮮明で文字化けがなく、手のモデルの肌の質感やハイライトもリアルです。以前はスタジオを借りてハンドモデルを雇う必要がありましたが、今ではプロンプト 1 つで完了します。

  • 头像
    sz1lhwiyf7
    オーディオとビデオの同期は素晴らしく、背景の蝉の鳴き声とナレーションはすべて自分で生成されているため、ポストダビングの必要はありません。

  • 头像
    Diane_Hicks369
    10,000 ポイントを消費し、100 本近くのビデオをテストしました。一番印象に残ったのは光と影と微細な表現です。おじいさんが画面を見下ろしながら目を細め、口をすぼめるときの老人の不器用さ、雨の夜、タクシーの窓の外で顔を横切るネオンの静かな緊張感など、キャラクターの一貫性は途方もなく安定しています。しかし、依然として物理学がひっくり返ったり、モデルが磨耗したり、キャラクターが突然消えたりすることがあります。

  • 头像
    WHicks_2021514
    Qianwen アプリで試してみて、パリの路上でシーンに入りました。カメラがヒロインからヒーローまでを追うとき、その移行は非常に自然です。光と影もテクスチャーになっています。全体として、期待を上回っています。

  • 头像
    Anthony.Williams_Max
    グレーテストの初日、公式サイトにアクセスして66ポイントを集めました。 32 ポイントを生成するのにわずか 5 秒しかかかりませんでした。価格も思ったより良心的でした。

  • 头像
    DRogers36995
    今回のハッピーホースは本当にすごいですね。

  • 头像
    Isabella_Torres520
    HappyHorseを試してみましたが、本当に素晴らしいです。テキストをビデオに変換するのは、以前に使用した Kling よりもはるかに高速です。重要なのは、生成されたビデオ内のキャラクターが体に変な歪みを与えることなく自然に動くことです。

  • 头像
    Alan_WoodSr8
    唯一の問題はポイントが足りないことです。基本バージョンでは、毎月 540 ポイントで 50 本以上のビデオしか生成されないため、価格性能比は平均的です。

  • 头像
    JHicksII
    今回のアリは本当におかしくなっている。 150 億のパラメータはオープンソースであり、自由に使用できます。それは素晴らしい!

  • 头像
    SarahJenkinsIII
    3 日間使用した後の私の感想は次のとおりです。オーディオとビデオの同期は確かに強力ですが、生成速度は公式の 38 秒よりも少し長くかかります。もしかしたら私のネットワークに問題があるのでしょうか?

  • 头像
    lazyduck280
    マルチカメラのナレーション機能は本格的ですか?とても便利です!シーンを説明すると、いくつかのショットが自動的にカットされるため、労力が大幅に節約されます。

  • 头像
    Jerry_MurrayK
    ローカル展開を実行したところ、8 カードの H100 はムービーを非常に高速に生成しますが、ビデオ メモリが少し不足していることがわかりました。 32G 以上のビデオメモリを搭載することをお勧めします。

  • 头像
    Jesse.Evans168
    Seedance 2.0 よりもはるかに安価で、自分で導入できます。いいね。

  • 头像
    Nicholas986
    まだ使ったことがない方は急いでクローズドベータに応募してください、本当に美味しいですよ!

  • 头像
    George.Ramirez0
    ネイティブオーディオ生成は本当に素晴らしいです。他のツールを使う前は自分でダビングする必要がありましたが、今では一発でダビングできるようになりました。

  • 头像
    黎月
    7か国語のリップシンクは複雑すぎます。将来的には、国境を越えたコンテンツの作成がはるかに簡単になるでしょう。

  • 头像
    MarkHendersonSr511
    評価ビデオを見た後、ELO 1357 は自慢ではありません。映像の滑らかさとセリフの復元力が非常に優れています。

  • 头像
    CoinAnalystH_enderson
    画質はまあまあで、1080p 出力は多くの有料ツールよりもはるかに鮮明です。

  • 头像
    MButler_2024_271
    オープンソースは無料なので、無駄に使用する必要はありません。すでにローカルで実行されています。

  • 头像
    烟雨745
    ただ気になるのは、4月30日のAPI公開後に値上がりするかどうか…。

  • 头像
    JScott_2021
    イーズ!殺された!

  • 头像
    whitebird444
    公式にモバイルAPPのリリースをリクエストしてください!今となってはパソコンでしかプレイできないのは不便すぎます。