Meta Muse Video

Meta 超級智慧實驗室首款自研文生影片模型,原生音訊與畫面一次生成

深度報告

  • 2026 年 7 月 7 日,Meta 超級智慧實驗室(Meta Superintelligence Labs,簡稱 MSL)在釋出自研影象模型 Muse Image 的同時,放出了影片模型 Muse Video 的早期預覽版。這是 Meta 第一款完全自研的文生影片模型,最大看點是「原生音訊」——聲音和畫面在同一個生成過程裡一次生成,而不是先出無聲影片再後期配樂。在 Arena 文生影片人工偏好榜單上,它首發就排到第三。模型目前仍是預覽狀態,尚未正式開放,Meta 自己也承認在音畫同步和快速運動的物理準確性上還有明顯短板。

  • Muse Video 由 Alexandr Wang 領導的 Meta 超級智慧實驗室操刀,是繼 2026 年 4 月語言模型 Muse Spark、6 月影象模型 Muse Image 之後,MSL 的第三個重要模型釋出。它和 Muse Image 共享同一套預訓練底座,只是把能力從靜態影象延伸到會動的畫面。這個釋出的戰略意義很清楚:Meta 想擺脫對 Midjourney、Black Forest Labs 等第三方生圖工具的依賴,把影象和影片生成都收進自己的「Muse」品牌矩陣,跟 Muse Spark 推理模型、Meta AI 產品綁成一套完整的多模態創作棧。MSL 在 X 上的官方賬號 @AIatMeta 於 7 月 8 日發帖確認了這次釋出。

  • Muse Video 最核心的能力是文字生成影片,也支援圖生影片。和大多數先生成無聲片段、再用音訊模型補聲音的文生影片模型不同,它把對話、環境音、配樂和畫面在同一個生成過程裡一起算出來,理論上音畫從一開始就對齊。Meta 官方強調它在三個維度上表現有競爭力:提示詞遵循度(prompt adherence)、視覺保真度(visual fidelity)、以及跨幀的時間一致性(temporal consistency,即人物身份、場景、運鏡在多鏡頭裡保持穩定)。 從產品頁 musevideo.dev 的線上試用生成器看,使用者能直接描述場景(主體、運鏡、光線、對白、音效),可選文生影片或圖生影片,解析度給到 480p 和 720p,時長從 4 秒到 15 秒,畫面比例覆蓋 16:9、9:16、1:1、21:9 等,還有 Fast(便宜)和 Higher quality(720p)兩種模式。底層走的是 MSL 的 agentic 媒體框架,推理時會做推理、呼叫工具、自我修正,和 Muse Image 一脈相承。 不過 Meta 自己把短板講得很直白:一是快速場景裡的音畫同步,尤其是口型對位(lip-sync)還不穩定;二是快速運動(體育、動作戲)的物理合理性不足,會出現運動模糊和時間上的偽影。這些正是預覽版釋出前團隊重點攻堅的方向。

  • Muse Video 目前是預覽版,正式定價尚未公佈。從產品頁的試用生成器能看出它的計費思路:按 credit 走,480p 大約 40 credits/秒,一次生成約 160 credits,註冊會送免費額度。作為參照,同門的 Muse Image 在 Meta AI 裡基礎使用免費,重度使用則被擋在 Meta One 等月度訂閱計劃後面;而 MSL 同期對 Muse Spark API 做過最高 80% 的降價,外界普遍預期 Muse Video 正式釋出時價格會相當激進。對開發者來說,Meta 的打算是把 Muse Image、Muse Video、Muse Spark 打包進同一個 API,讓做多模態應用的團隊不用再拼接多家供應商。

  • 預覽放出後,早期上手的人反饋分化明顯。正面的一方覺得它的畫面質感接近位元組的 Seedance 2.0,有時甚至更好,明顯強過 Google Veo 3.1;原生音訊是真正的殺手鐧,有人把自己的 Reels 工作流從三個工具砍到一個提示框,口播類影片不用再單獨錄旁白。另一邊,不少測試者指出它目前卡在 10 秒左右的時長上限,而 Seedance 2.0 已經能出 15 秒、最高 4K 的電影感片段;還有人抱怨快節奏鏡頭裡身體動作和聲音對不上,一看就是 AI 生成的痕跡。

  • 在 2026 年 7 月的文生影片格局裡,第一梯隊是 OpenAI 的 Sora 2 Pro(電影感天花板、僅 ChatGPT Pro 檔可用)、Google 的 Veo(提示詞遵循和物理最穩、已在 Google Cloud 全面可用)、位元組的 Seedance 2.5(原生 30 秒、本地編輯),再加上 Runway、Kling、Pika。橫向比,Muse Video 的獨門優勢是原生音訊加 Meta 的分發覆蓋——一旦正式版進 Instagram、WhatsApp、Meta AI,它靠著三十億日活可能一夜之間變成用得最多的影片模型。它的軟肋是仍在預覽期、沒有明確的 GA 日期,電影感暫時跟 Sora 2 Pro 有差距,而音畫同步和快動作又是 Meta 自己認領的弱項。多數行業分析認為,它真正能打的場景是社交短影片和原生音訊內容,專業影視還得等它補齊短板。

  • Muse Video 本身沒踩太大的雷,但它和 Muse Image 共享架構、要走同樣的消費級產品路徑,所以 Muse Image 的隱私風波繞不開。Muse Image 上線後,Instagram 預設把使用者公開賬號「勾選」進一個功能,允許別人用這些公開照片生成新的 AI 影象,而照片主人毫不知情。演員工會 SAG-AFTRA 等團體批評這是在為騷擾和冒用開方便之門。Meta 在 2026 年 7 月 10 日把 Instagram 上的這個跨賬號 remix 功能整個下架,承認「missed the mark」(沒做到位);不過 Muse Image 本體在 Meta AI app 和 WhatsApp 裡一直可用。這個前車之鑑意味著,等 Muse Video 正式進 Instagram 時,資料授權和肖像權的問題很可能會重新被擺上檯面。另外,作為閉源模型,它沒有公開 API、也不像開源權重那樣可被審計,專業精度上偶有翻車。

  • 如果你做的是社交短影片、廣告切片、產品預熱、教育素材這類「帶聲音、短平快」的內容,且本來就活躍在 Instagram/WhatsApp 生態裡,Muse Video 值得等它的正式版——原生音訊真的能省一道工序。若是追求電影級質感、長鏡頭或精確動作的專業影視,現階段更穩妥的是 Sora 2 Pro 或 Veo;需要互動式編輯工作流的選 Runway;預算有限、追求快速迭代的可以看 Kling 或 Pika。需要提醒的是,所有生成內容如果商用,都要確保提示詞不侵犯第三方權益、符合平臺內容政策;正式版出來前,用它做生產級交付還不現實。

  • Muse Video 是 Meta 用同一套底座把影象和影片捏成一個創作棧的關鍵一步,原生音訊和三十億級分發渠道讓它天生帶著別人沒有的牌;但它現在還是預覽版,音畫同步和快動作的硬傷沒補完之前,更適合在社交短影片裡「等它長大」,而不是現在就拿來扛專業活。

使用者評論

  • 頭像
    劉然桂
    原生音訊真的香,省了後期配樂那一步。

  • 頭像
    BStephens_2022
    Arena 排第三,Meta 這次確實有點東西。

  • 頭像
    WOgom
    卡在 10 秒太難受了,做不了長鏡頭。

  • 頭像
    ya4prrkzml
    我拿它和 Seedance 2.0 仔細比過一輪。畫面質感確實很接近,有時還略好,但時長差了一大截——Seedance 2.0 已經能一口氣出 15 秒、最高 4K 的電影感片段,Muse Video 預覽版還卡在 10 秒左右,解析度也只到 720p。做產品預熱短片夠用,正經廣告還差口氣。

  • 頭像
    MJenkinsQ
    我們團隊把 Reels 工作流從三個工具砍到一個提示框,口播類影片不用再單獨錄旁白了,這一步省下的時間很實在。不過快節奏鏡頭裡嘴型和聲音還是對不上,走路帶風的轉場偶爾也會糊,一看就是 AI 的痕跡。我的建議是正式版之前,訪談、口播、快動作這類場景最好別碰,拿它做靜態或中低速的社媒切片更穩。

  • 頭像
    AmyThomas_2021
    Instagram 那個拿別人照片生成 AI 圖的鬧劇剛平息,Muse Video 進 Instagram 時肖像權問題八成還會再炸一次。

  • 頭像
    Dennis.RichardsonIII
    預覽版,等等黨贏了。

  • 頭像
    Pamela_Roberts_7481
    和 Muse Image 同底座挺好,先把圖做出來再丟進 Muse Video 動起來,流程很順。

  • 頭像
    Scott_Parker_2023855
    閉源沒 API,想接進自己產品還得等。

  • 頭像
    AAnderson_66
    比 Veo 3.1 強,至少早期實測是這麼說的。

  • 頭像
    8_3rtf
    橫向比下來它的獨門牌就是原生音訊加三十億日活分發。Sora 2 Pro、Veo 畫質確實更頂,但那是要付錢、要切平臺的。Meta 一旦把 Muse Video 正式塞進 Instagram 和 WhatsApp,靠預設入口它一夜之間就是用得最多的影片模型,這才是 Meta 真正的打法——不是單純拼畫質,而是把創作鎖進自己的生態裡。

  • 頭像
    MarkHendersonSr511
    credit 計費 40 credits/秒,註冊送免費額度,重度用估計還是得訂閱,價格沒公佈先觀望。

  • 頭像
    PPerry_99
    音畫同步和運動物理是 Meta 自己在釋出裡認領的短板,這點挺誠實。動作戲、體育、跳舞這類大機率翻車,口型對位也還沒穩。現在拿它做東西一定得人工複核,別直接發。但它迭代速度很快,參考 Muse Image 從釋出到修隱私問題只用了三天,三個月後再看這幾個坑大機率就補齊了。

  • 頭像
    Olivia511
    Sora 2 Pro 還是天花板。

  • 頭像
    Katherine_MorganX5
    prompt 遵循度不錯,我寫「逆光黃金時段淺景深手持跟拍」,它真給到了對應鏡頭語言。

  • 頭像
    DragoslavDaničić
    概念驗證夠用,生產交付還早。

  • 頭像
    趙蘭浩
    對社媒創作者和小團隊最划算的就是自帶聲音,產品預熱、教學片段從零直接出帶音影片,不用再開剪映配 BGM。但商用有幾個坑要記牢:提示詞別寫進別人肖像或受版權保護的素材,平臺內容政策得守,生成內容如果涉及真人最好先拿到授權。預覽期拿來試水沒問題,真要批次商用還是等正式版和明確的許可條款。

  • 頭像
    KBell369
    Muse Image 的隱私風波里 Meta 在 7 月 10 日把跨賬號 remix 下架了,承認 missed the mark,這條對判斷 Muse Video 上 Instagram 的風險很有參考價值。

  • 頭像
    盧萱_1
    等 GA,現在只能玩玩預覽。