Meta Muse Video

Meta 超级智能实验室首款自研文生视频模型,原生音频与画面一次生成

詳細レポート

  • 2026 年 7 月 7 日、Meta Superintelligence Labs (MSL) は、ビデオ モデル Muse Video の初期プレビュー バージョンをリリースすると同時に、自社開発の画像モデル Muse Image をリリースしました。これは、Meta が初めて完全に自社開発した Vincent ビデオ モデルです。最大のハイライトは「ネイティブ オーディオ」です。最初にサイレント ビデオを作成し、後でサウンドトラックするのではなく、サウンドと画像が同じ生成プロセスで同時に生成されます。 Arena Vincent Video の人工優先リストでは、初登場時に 3 位にランクされました。このモデルはまだプレビュー段階にあり、正式にはリリースされていません。 Meta 自身も、オーディオとビデオの同期や素早い動きの物理的精度に依然として明らかな欠点があることを認めています。

  • Muse Video は、Alexandr Wang 率いるメタ スーパー インテリジェンス研究所によって運営されています。これは、2026 年 4 月の言語モデル Muse Spark、6 月のイメージ モデル Muse Image に続く、MSL の 3 番目の重要なモデル リリースです。 Muse Image と同じ事前トレーニングされたベースを共有していますが、その機能は静止画像から動画まで拡張されています。このリリースの戦略的重要性は明らかです。Meta は、Midjourney や Black Forest Labs などのサードパーティ グラフィック ツールへの依存を排除​​し、画像とビデオの生成を自社の「Muse」ブランド マトリックスに統合し、それを Muse Spark 推論モデルおよび Meta AI 製品と結び付けて完全なマルチモーダル作成スタックにしたいと考えています。 X の MSL の公式アカウント @AIatMeta は、7 月 8 日の投稿でこのリリースを認めました。

  • Muse Video の中核となる機能はテキストからビデオを生成することであり、画像ベースのビデオもサポートしています。最初にサイレント クリップを生成し、次にオーディオ モデルを使用してサウンドを埋めるほとんどの Vincent ビデオ モデルとは異なり、ダイアログ、環境音、サウンドトラック、画像を同じ生成プロセスで一緒に計算します。理論的には、音と映像は最初から一致しています。 Meta は公式に、迅速な遵守、視覚的な忠実性、フレーム間の時間的一貫性 (時間的一貫性、つまりキャラクターのアイデンティティ、シーン、カメラの動きが複数のショットで安定していること) の 3 つの次元で競争力のあるパフォーマンスを発揮することを強調しています。 製品ページ musevideo.dev のオンライン トライアル ジェネレーターから判断すると、ユーザーはシーン (被写体、カメラの動き、照明、ダイアログ、音響効果) を直接説明でき、Vincent ビデオまたは Tusheng ビデオを選択でき、解像度は 480p および 720p、継続時間は 4 秒から 15 秒、アスペクト比は 16:9、9:16、1:1、21:9 などをカバーし、次の 2 つのモードがあります。 (安価)かつ高品質(720p)。最下層は MSL のエージェント メディア フレームワークを使用します。推論を実行し、ツールを呼び出し、推論中に自己修正します。これは Muse Image と同じ流れです。 ただし、Meta 自体はその欠点を非常に単純化しました。まず、速いシーンでのオーディオとビデオの同期、特にリップシンクが安定しません。第二に、速い動き(スポーツ、アクションシーン)の物理的合理性が不十分であり、モーションブラーや時間的アーティファクトが発生します。これらはまさに、プレビュー バージョンがリリースされる前にチームが注力する方向です。

  • Muse Video は現在プレビュー段階であり、正式な価格はまだ発表されていません。製品ページのトライアル ジェネレーターからその請求のアイデアを確認できます。プレス クレジット、480p のコストは約 40 クレジット/秒で、一度に約 160 クレジットが生成されます。登録すると無料のクレジットが付与されます。参考として、Meta AI での Muse Image の基本的な使用は無料で、頻繁な使用は Meta One などの月額サブスクリプション プランでブロックされます。一方、MSL は同期間中に Muse Spark API の価格を最大 80% 値下げしました。一般に、Muse Video が正式にリリースされると、その価格は非常に高くなることが予想されます。開発者向けに、Meta の計画は、Muse Image、Muse Video、および Muse Spark を同じ API にパッケージ化し、マルチモーダル アプリケーションに取り組んでいるチームが複数のサプライヤーに接続する必要がなくなるようにすることです。

  • プレビューがリリースされた後、早期に開始したユーザーからのフィードバックは明らかに分かれました。良い面としては、画質が Byte の Seedance 2.0 に近く、場合によっては Google Veo 3.1 より明らかに優れていると感じます。ネイティブ オーディオが真のキラーであり、リール ワークフローを 3 つのツールから 1 つのプロンプト ボックスに削減した人もいます。また、話し言葉ビデオのナレーションを個別に録音する必要はありません。一方で、多くのテスターは、Seedance 2.0 はすでに 15 秒、最大 4K 映画のようなクリップを生成できるのに対し、現在は約 10 秒の上限に止まっていると指摘しました。また、速いペースのショットで体の動きと音が一致しないと苦情を言う人もいましたが、一見すると AI 生成によって追跡されました。

  • 2026 年 7 月の Vincent ビデオ ランドスケープでは、最初の層は OpenAI の Sora 2 Pro (シネマティック シーリング、ChatGPT Pro ファイルでのみ利用可能)、Google の Veo (プロンプト ワード コンプライアンスと物理学が最も安定しており、Google Cloud で完全に利用可能)、Byte の Seedance 2.5 (ネイティブ 30 秒、ローカル編集)、さらに Runway、Kling、Pika です。水平的に見ると、Muse Video の独自の利点は、ネイティブ オーディオに加えて Meta の配信範囲をカバーしていることです。Instagram、WhatsApp、Meta AI で正式にリリースされれば、一夜にして 1 日あたり 30 億人のユーザーが利用する最も使用されるビデオ モデルになる可能性があります。弱点は、まだプレビュー期間中であり、明確な GA の日付がないことです。映画のような雰囲気は一時的に Sora 2 Pro とは異なり、オーディオとビジュアルの同期と高速モーションは Meta 自身が主張する弱点です。ほとんどの業界アナリストは、同社が実際に競争できるシナリオはソーシャルショートビデオとネイティブオーディオコンテンツであり、プロの映画やテレビがその欠点を補うのを待つ必要があると考えています。

  • Muse Video 自体はそれほど大きな話題にはならなかったが、アーキテクチャを Muse Image と共有し、同じ消費者向け製品の道をたどったため、Muse Image のプライバシー論争は避けられなかった。 Muse Imageがオンラインになった後、Instagramはユーザーの公開アカウントをデフォルトで機能に「チェック」し、他のユーザーがこれらの公開写真を使用して写真の所有者に知られずに新しいAI画像を生成できるようにした。俳優組合SAG-AFTRAなどの団体は、これが嫌がらせやなりすましへの扉を開くものだと批判した。 Meta は 2026 年 7 月 10 日に Instagram のクロスアカウント リミックス機能全体を削除し、「的外れだった」ことを認めた。ただし、Muse 画像自体は、Meta AI アプリと WhatsApp で常に利用可能でした。この過去の教訓は、Muse VideoがInstagramに正式参入する際には、データの認可と肖像権の問題が再び俎上に上る可能性が高いことを意味している。さらに、クローズドソース モデルとしてパブリック API がなく、オープンソースの重み付けのように監査できないため、専門的な精度が損なわれることがあります。

  • ソーシャルショートビデオ、広告スライス、製品のウォームアップ、教育資料などの「短くて速い」コンテンツを作成していて、すでに Instagram/WhatsApp エコシステムで活動している場合、Muse Video の正式バージョンを待つ価値があります。ネイティブオーディオは実際にプロセスを節約できます。映画のような品質、ロングショット、または正確な動きを備えたプロフェッショナルな映画やテレビを追求している場合、この段階では Sora 2 Pro または Veo の方が信頼性が高くなります。インタラクティブな編集ワークフローが必要な場合は、「Runway」を選択します。予算が限られており、迅速な反復を求める場合は、Kling または Pika を検討してください。生成されたすべてのコンテンツが商業的に使用される場合、プロンプトの言葉が第三者の権利を侵害せず、プラットフォームのコンテンツ ポリシーに準拠していることを確認する必要があることに注意してください。正式バージョンがリリースされる前に、それを運用レベルの配信に使用することは現実的ではありません。

  • Muse Video は、Meta が同じベースのセットを使用して画像とビデオをクリエイティブ スタックに組み合わせるための重要なステップです。ネイティブ オーディオと 30 億の配信チャネルにより、他社にはない当然の利点が得られます。しかし、それはまだプレビュー版です。オーディオとビデオの同期や高速モーションの欠点が修復されるまでは、今すぐプロの仕事に使用するよりも、ソーシャルショートビデオで「成長するのを待つ」方が適しています。

ユーザーレビュー

  • 头像
    刘然桂
    ネイティブオーディオは非常に優れており、ポストプロダクションサウンドトラッキングの必要がなくなります。

  • 头像
    BStephens_2022
    アリーナは3位で、メタは今回何かを持っています。

  • 头像
    WOgom
    10秒で止まってしまうのは、ロングショットをするにはあまりにも不快です。

  • 头像
    ya4prrkzml
    Seedance 2.0とじっくり比較してみました。画質は確かに非常に近い、場合によってはわずかに優れていますが、持続時間はまったく異なります。Seedance 2.0 はすでに 15 秒、最大 4K の映画のようなクリップを一度に作成できますが、Muse Video のプレビュー バージョンはまだ約 10 秒で止まっており、解像度はわずか 720p です。短い製品プレビュービデオは十分ですが、本格的な広告は十分ではありません。

  • 头像
    MJenkinsQ
    私たちのチームは、Reels ワークフローを 3 つのツールから 1 つのプロンプト ボックスに減らしました。話し言葉ビデオの場合、個別のナレーションを録音する必要はありません。このステップにより、リアルタイム時間が節約されます。ただし、テンポの速いショットではまだ口の形と声が一致していませんし、風の中を歩いているときのトランジションは時々ぼやけており、これはAIの痕跡と見なすことができます。私の提案は、正式リリース前は、インタビュー、口頭放送、速い動きなどのシーンに触れない方がよいということです。静的または中低速のソーシャル メディア スライスに使用すると、より安定します。

  • 头像
    AmyThomas_2021
    他人の写真を使用して AI 写真を生成する Instagram の茶番劇はようやく沈静化しました。 Muse VideoがInstagramに参入すると、また肖像権問題が噴出するだろう。

  • 头像
    Dennis.RichardsonIII
    プレビュー版は、パーティーが勝つまで待ちます。

  • 头像
    Pamela_Roberts_7481
    ミューズイメージとベースが同じなのが良いですね。最初に画像を作成してから、それを Muse Video に放り込んで動かします。プロセスは非常にスムーズです。

  • 头像
    Scott_Parker_2023855
    クローズド ソースには API がないため、独自の製品に接続するまで待つ必要があります。

  • 头像
    AAnderson_66
    Veo 3.1 よりも優れている、少なくとも初期のテストではそう言えます。

  • 头像
    8_3rtf
    水平的な比較から見ると、同社のユニークなブランドは、ネイティブ オーディオと 1 日あたり 30 億のアクティブな配信です。 Sora 2 Pro と Veo は画質が優れていますが、それには支払いと別のプラットフォームが必要です。 Meta が Muse Video を Instagram と WhatsApp に正式に接続すると、一夜にしてデフォルトで最も使用されるビデオ モデルになりました。これが Meta の本当のアプローチです。単に画質を求めて戦うのではなく、創作物を独自のエコシステムに閉じ込めることです。

  • 头像
    MarkHendersonSr511
    クレジット課金は40クレジット/秒で、登録すると無料でクレジットが付与されます。頻繁に使用する場合は、サブスクリプションが必要になる場合があります。価格はまだ発表されていない。様子を見てみます。

  • 头像
    PPerry_99
    オーディオとビジュアルの同期とモーション物理は、Meta 自身がリリース時に欠点を認めていましたが、これは非常に正直です。アクションシーンやスポーツ、ダンスなどは転倒する可能性が高く、リップシンクの合わせがまだ安定していません。これを使用して何かを作成する場合は、直接送信しないで、手動でレビューする必要があります。しかし、それは非常に速く繰り返されます。参考までに、Muse Image はリリースからプライバシー問題の修正までわずか 3 日しかかかりませんでした。 3 か月後に見ると、これらの落とし穴は修正される可能性が高くなります。

  • 头像
    Olivia511
    Sora 2 Proはまだ天井です。

  • 头像
    Katherine_MorganX5
    プロンプトは適切に続きます。 「逆光ゴールデンタイムの被写界深度の浅い手持ち追撃撮影」と書きましたが、まさに対応レンズの言葉が分かりました。

  • 头像
    DragoslavDaničić
    概念実証は十分ですが、製品出荷はまだ早いです。

  • 头像
    赵兰浩
    ソーシャル メディア クリエイターや小規模チームにとって最も費用対効果の高い方法は、独自のサウンドを持ち込むことです。製品のウォームアップ クリップやティーチング クリップは、BGM を編集したり合わせたりすることなく、オーディオとビデオを使用して最初から直接作成できます。ただし、商業的に使用する場合は注意すべき落とし穴がいくつかあります。プロンプトに他人の肖像画や著作権で保護された素材を含めないこと、プラットフォームのコンテンツ ポリシーに従うこと、生成されたコンテンツに実在の人物が含まれる場合は、最初に承認を得ることが最善です。プレビュー期間中に水をテストすることは問題ありません。本当に一括で商用化したい場合は、正式版を待ってライセンス条件をクリアする必要があります。

  • 头像
    KBell369
    Muse Imageのプライバシースキャンダルの最中、Metaは7月10日にクロスアカウントのリミックスを棚から削除し、的外れだったことを認めた。これは、Instagram 上の Muse Video のリスクを判断するための貴重な参考資料となります。

  • 头像
    卢萱_1
    GA を待っていますが、現在はプレビューのみをプレイできます。