深度报告
-
2026 年 7 月 7 日,Meta 超级智能实验室(Meta Superintelligence Labs,简称 MSL)在发布自研图像模型 Muse Image 的同时,放出了视频模型 Muse Video 的早期预览版。这是 Meta 第一款完全自研的文生视频模型,最大看点是「原生音频」——声音和画面在同一个生成过程里一次生成,而不是先出无声视频再后期配乐。在 Arena 文生视频人工偏好榜单上,它首发就排到第三。模型目前仍是预览状态,尚未正式开放,Meta 自己也承认在音画同步和快速运动的物理准确性上还有明显短板。
-
Muse Video 由 Alexandr Wang 领导的 Meta 超级智能实验室操刀,是继 2026 年 4 月语言模型 Muse Spark、6 月图像模型 Muse Image 之后,MSL 的第三个重要模型发布。它和 Muse Image 共享同一套预训练底座,只是把能力从静态图像延伸到会动的画面。这个发布的战略意义很清楚:Meta 想摆脱对 Midjourney、Black Forest Labs 等第三方生图工具的依赖,把图像和视频生成都收进自己的「Muse」品牌矩阵,跟 Muse Spark 推理模型、Meta AI 产品绑成一套完整的多模态创作栈。MSL 在 X 上的官方账号 @AIatMeta 于 7 月 8 日发帖确认了这次发布。
-
Muse Video 最核心的能力是文本生成视频,也支持图生视频。和大多数先生成无声片段、再用音频模型补声音的文生视频模型不同,它把对话、环境音、配乐和画面在同一个生成过程里一起算出来,理论上音画从一开始就对齐。Meta 官方强调它在三个维度上表现有竞争力:提示词遵循度(prompt adherence)、视觉保真度(visual fidelity)、以及跨帧的时间一致性(temporal consistency,即人物身份、场景、运镜在多镜头里保持稳定)。 从产品页 musevideo.dev 的在线试用生成器看,用户能直接描述场景(主体、运镜、光线、对白、音效),可选文生视频或图生视频,分辨率给到 480p 和 720p,时长从 4 秒到 15 秒,画面比例覆盖 16:9、9:16、1:1、21:9 等,还有 Fast(便宜)和 Higher quality(720p)两种模式。底层走的是 MSL 的 agentic 媒体框架,推理时会做推理、调用工具、自我修正,和 Muse Image 一脉相承。 不过 Meta 自己把短板讲得很直白:一是快速场景里的音画同步,尤其是口型对位(lip-sync)还不稳定;二是快速运动(体育、动作戏)的物理合理性不足,会出现运动模糊和时间上的伪影。这些正是预览版发布前团队重点攻坚的方向。
-
Muse Video 目前是预览版,正式定价尚未公布。从产品页的试用生成器能看出它的计费思路:按 credit 走,480p 大约 40 credits/秒,一次生成约 160 credits,注册会送免费额度。作为参照,同门的 Muse Image 在 Meta AI 里基础使用免费,重度使用则被挡在 Meta One 等月度订阅计划后面;而 MSL 同期对 Muse Spark API 做过最高 80% 的降价,外界普遍预期 Muse Video 正式发布时价格会相当激进。对开发者来说,Meta 的打算是把 Muse Image、Muse Video、Muse Spark 打包进同一个 API,让做多模态应用的团队不用再拼接多家供应商。
-
预览放出后,早期上手的人反馈分化明显。正面的一方觉得它的画面质感接近字节的 Seedance 2.0,有时甚至更好,明显强过 Google Veo 3.1;原生音频是真正的杀手锏,有人把自己的 Reels 工作流从三个工具砍到一个提示框,口播类视频不用再单独录旁白。另一边,不少测试者指出它目前卡在 10 秒左右的时长上限,而 Seedance 2.0 已经能出 15 秒、最高 4K 的电影感片段;还有人抱怨快节奏镜头里身体动作和声音对不上,一看就是 AI 生成的痕迹。
-
在 2026 年 7 月的文生视频格局里,第一梯队是 OpenAI 的 Sora 2 Pro(电影感天花板、仅 ChatGPT Pro 档可用)、Google 的 Veo(提示词遵循和物理最稳、已在 Google Cloud 全面可用)、字节的 Seedance 2.5(原生 30 秒、本地编辑),再加上 Runway、Kling、Pika。横向比,Muse Video 的独门优势是原生音频加 Meta 的分发覆盖——一旦正式版进 Instagram、WhatsApp、Meta AI,它靠着三十亿日活可能一夜之间变成用得最多的视频模型。它的软肋是仍在预览期、没有明确的 GA 日期,电影感暂时跟 Sora 2 Pro 有差距,而音画同步和快动作又是 Meta 自己认领的弱项。多数行业分析认为,它真正能打的场景是社交短视频和原生音频内容,专业影视还得等它补齐短板。
-
Muse Video 本身没踩太大的雷,但它和 Muse Image 共享架构、要走同样的消费级产品路径,所以 Muse Image 的隐私风波绕不开。Muse Image 上线后,Instagram 默认把用户公开账号「勾选」进一个功能,允许别人用这些公开照片生成新的 AI 图像,而照片主人毫不知情。演员工会 SAG-AFTRA 等团体批评这是在为骚扰和冒用开方便之门。Meta 在 2026 年 7 月 10 日把 Instagram 上的这个跨账号 remix 功能整个下架,承认「missed the mark」(没做到位);不过 Muse Image 本体在 Meta AI app 和 WhatsApp 里一直可用。这个前车之鉴意味着,等 Muse Video 正式进 Instagram 时,数据授权和肖像权的问题很可能会重新被摆上台面。另外,作为闭源模型,它没有公开 API、也不像开源权重那样可被审计,专业精度上偶有翻车。
-
如果你做的是社交短视频、广告切片、产品预热、教育素材这类「带声音、短平快」的内容,且本来就活跃在 Instagram/WhatsApp 生态里,Muse Video 值得等它的正式版——原生音频真的能省一道工序。若是追求电影级质感、长镜头或精确动作的专业影视,现阶段更稳妥的是 Sora 2 Pro 或 Veo;需要交互式编辑工作流的选 Runway;预算有限、追求快速迭代的可以看 Kling 或 Pika。需要提醒的是,所有生成内容如果商用,都要确保提示词不侵犯第三方权益、符合平台内容政策;正式版出来前,用它做生产级交付还不现实。
-
Muse Video 是 Meta 用同一套底座把图像和视频捏成一个创作栈的关键一步,原生音频和三十亿级分发渠道让它天生带着别人没有的牌;但它现在还是预览版,音画同步和快动作的硬伤没补完之前,更适合在社交短视频里「等它长大」,而不是现在就拿来扛专业活。
用户评论
-
刘然桂—原生音频真的香,省了后期配乐那一步。 -
BStephens_2022—Arena 排第三,Meta 这次确实有点东西。 -
WOgom—卡在 10 秒太难受了,做不了长镜头。 -
ya4prrkzml—我拿它和 Seedance 2.0 仔细比过一轮。画面质感确实很接近,有时还略好,但时长差了一大截——Seedance 2.0 已经能一口气出 15 秒、最高 4K 的电影感片段,Muse Video 预览版还卡在 10 秒左右,分辨率也只到 720p。做产品预热短片够用,正经广告还差口气。 -
MJenkinsQ—我们团队把 Reels 工作流从三个工具砍到一个提示框,口播类视频不用再单独录旁白了,这一步省下的时间很实在。不过快节奏镜头里嘴型和声音还是对不上,走路带风的转场偶尔也会糊,一看就是 AI 的痕迹。我的建议是正式版之前,访谈、口播、快动作这类场景最好别碰,拿它做静态或中低速的社媒切片更稳。 -
AmyThomas_2021—Instagram 那个拿别人照片生成 AI 图的闹剧刚平息,Muse Video 进 Instagram 时肖像权问题八成还会再炸一次。 -
Dennis.RichardsonIII—预览版,等等党赢了。 -
Pamela_Roberts_7481—和 Muse Image 同底座挺好,先把图做出来再丢进 Muse Video 动起来,流程很顺。 -
Scott_Parker_2023855—闭源没 API,想接进自己产品还得等。 -
AAnderson_66—比 Veo 3.1 强,至少早期实测是这么说的。 -
8_3rtf—横向比下来它的独门牌就是原生音频加三十亿日活分发。Sora 2 Pro、Veo 画质确实更顶,但那是要付钱、要切平台的。Meta 一旦把 Muse Video 正式塞进 Instagram 和 WhatsApp,靠默认入口它一夜之间就是用得最多的视频模型,这才是 Meta 真正的打法——不是单纯拼画质,而是把创作锁进自己的生态里。 -
MarkHendersonSr511—credit 计费 40 credits/秒,注册送免费额度,重度用估计还是得订阅,价格没公布先观望。 -
PPerry_99—音画同步和运动物理是 Meta 自己在发布里认领的短板,这点挺诚实。动作戏、体育、跳舞这类大概率翻车,口型对位也还没稳。现在拿它做东西一定得人工复核,别直接发。但它迭代速度很快,参考 Muse Image 从发布到修隐私问题只用了三天,三个月后再看这几个坑大概率就补齐了。 -
Olivia511—Sora 2 Pro 还是天花板。 -
Katherine_MorganX5—prompt 遵循度不错,我写「逆光黄金时段浅景深手持跟拍」,它真给到了对应镜头语言。 -
DragoslavDaničić—概念验证够用,生产交付还早。 -
赵兰浩—对社媒创作者和小团队最划算的就是自带声音,产品预热、教学片段从零直接出带音视频,不用再开剪映配 BGM。但商用有几个坑要记牢:提示词别写进别人肖像或受版权保护的素材,平台内容政策得守,生成内容如果涉及真人最好先拿到授权。预览期拿来试水没问题,真要批量商用还是等正式版和明确的许可条款。 -
KBell369—Muse Image 的隐私风波里 Meta 在 7 月 10 日把跨账号 remix 下架了,承认 missed the mark,这条对判断 Muse Video 上 Instagram 的风险很有参考价值。 -
卢萱_1—等 GA,现在只能玩玩预览。