深度报告
-
通义万相 Wan 是阿里巴巴通义实验室推出的 AI 创意生成平台,涵盖文生图、图生图、文生视频、图生视频及图像编辑等核心能力。作为国产AI视频生成领域的头部产品,Wan 系列凭借开源策略、270亿参数混合专家架构和原生多模态能力,在全球 AI 视频生成赛道中占据重要地位。2026年4月最新发布的 Wan 2.7 更打出"让视频像文档一样可编辑"的定位,通过思考模式、首末帧控制、九宫格多图合成等创新功能,将视频创作从"抽卡式生成"推向"精准导演"的新阶段。
-
通义万相隶属于阿里巴巴"通义"大模型产品矩阵,与通义千问、通义听悟等构成阿里云在大模型时代的内容生成生态。该产品最早于2023年7月在世界人工智能大会上开启定向邀测,主打 AI 绘画创作功能。经过近三年迭代,Wan 已从单一的图像生成工具演进为覆盖图像、视频、3D 模型的全栈 AIGC 平台。 从开源策略来看,阿里巴巴采取了相对开放的态度。2025年2月25日发布的 Wan 2.1 曾在发布次日即宣布开源,供全球学术、研究和商业机构使用。2025年3月26日,阿里团队发表学术论文《Wan: Open and Advanced Large-Scale Video Generative Models》,公开了完整的技术架构和训练细节,其中14B参数高性能版本基于数十亿级图片和视频数据集训练,1.3B轻量级版本仅需8.19GB显存即可在消费级 GPU 上运行。这一开源策略帮助 Wan 在全球开发者社区中建立了良好口碑。 从公司战略角度看,通义万相是阿里云"百炼"大模型服务平台的核心能力之一,用户可通过百炼平台直接调用 API,将 Wan 的生成能力集成到各类应用中。
-
通义万相 Wan 提供的功能可分为四大类别: 图像生成方面,平台支持文生图(text-to-image)、图生图(image-to-image)、草图生图(sketch-to-image)三种主要模式,并内置风格迁移、图像分割、超分辨率、智能编辑等图像编辑工具。用户可以通过简单的文字描述生成高质量图片,也可以上传现有图片进行风格转换或内容替换。 视频生成方面,Wan 是其核心竞争力所在。支持文生视频(text-to-video)和图生视频(image-to-video)两大基础能力,最新一代 Wan 2.7 基于270亿参数混合专家架构,可生成最高1080P分辨率、24fps 的高清视频,每次生成时长2至15秒。 其他扩展功能包括虚拟模特(virtual_model)、文字艺术图片、AI 音乐生成(text_to_music)、卡通头像等,覆盖了从商业设计到个人娱乐的多元场景。 Wan 2.7 核心升级: 2026年4月发布的 Wan 2.7 带来了六项关键功能升级: 思考模式是最大亮点之一。在渲染画面之前,模型会先理解用户提示词并规划构图、镜头运动与叙事节奏,生成的视频更具"导演刻意编排"的观感,而非随机元素拼接。 首末帧控制功能支持同时锁定视频的起始帧和结束帧,由模型自动推演中间过渡过程,适用于变形转场、剧情匹配剪辑和分镜驱动制作。 九宫格多图合成最多支持上传9张参考图,将其拼接为一段连续视频,每张图作为独立场景并实现场景间的平滑过渡。 主体与声音参考功能允许用户上传人物、物品或角色的参考图,并可叠加声音样本,确保整段视频中角色外观与声线保持高度一致。 原生音频同步在生成画面的同时同步生成背景音乐、环境音效与人物对白,口型、动作节奏与音乐卡点天然对齐,无需后期手动混音。 指令式视频编辑支持使用自然语言描述修改需求,如更换背景、调整光线、更换服装,模型会在保留原视频动作结构的前提下进行重绘。 与前代版本对比: 从 Wan 2.5 到 Wan 2.6 的迭代中,视频时长从10秒延长至15秒,实现了从单镜头表演到多镜头叙事的能力跨越,新增的智能分镜功能可自动将提示词转化为专业分镜脚本。Wan 2.7 则在此基础上引入 MoE 架构和思考模式,实现了从"执行者"到"导演"的角色升级。
-
通义万相 Wan 采用云端 API 调用的计费模式,通过阿里云百炼平台提供服务。 免费额度方面,开通百炼平台后的90天内可享受一定额度的免费试用。具体免费权益包括:文生图50张、视频类(文生视频、图生视频)各50秒。 收费方面,按实际使用量计费:文生图0.2元/张;文生视频和图生视频的720P分辨率版本0.6元/秒,1080P分辨率版本1元/秒。这一价格定位在主流 AI 视频生成工具中处于中等偏下水平,具有一定竞争力。 对于有更高频率使用需求的用户,可考虑购买阿里云百炼平台的资源包套餐或企业版服务。此外,Wan 系列部分模型(如 Wan 2.1)已开源,开发者可选择本地部署使用,但本地部署对硬件配置有一定要求。
-
从公开渠道收集的用户反馈来看,通义万相 Wan 的整体评价偏向正面。 正面评价主要集中在以下几个方面:作为国产工具,中文支持体验流畅,提示词理解准确;开源模型本地部署降低了使用成本;生成的写实人像较早期版本更加自然,"AI感"明显减少;音画同步能力在同类产品中处于领先水平;多镜头叙事功能获得专业创作者的认可。 负面反馈和批评主要集中在:复杂场景下指令遵循能力仍有提升空间;部分用户反映生成速度较慢,尤其在高峰期;1080P高清模式收费较高,长视频创作成本可观;视频角色扮演功能在多角度切换时偶发形象失真问题。 从第三方评测机构的测试来看,有评测指出 Wan 2.7 的"底层生成能力"与"上层编辑功能"之间存在一定落差——复杂的编辑功能对底层生成质量提出更高要求,当底层生成存在瑕疵时,编辑效果也会受到影响。
-
在 AI 视频生成赛道,通义万相 Wan 的主要竞争对手包括 OpenAI Sora、Runway Gen-3、Pika、Luma Dream Machine、可灵(Kling)、海螺视频等。从2026年的竞争格局来看,Wan 系列凭借开源策略和本土化优势,在中文市场具有较强的用户基础和品牌认知。 在 Artificial Analysis 等第三方评测榜单上,Wan 2.7 与 HappyHorse 1.0 等新兴模型形成激烈竞争。有分析认为,Wan 在技术指标上已接近国际第一梯队,但在产品化体验和商业化生态方面仍有追赶空间。 从行业趋势看,多模态融合(视频+音频+文字)已成为头部产品的共识方向,Wan 2.7 原生音频同步功能的强化正是顺应这一趋势。另一个显著趋势是精细化控制能力的增强,首末帧控制、指令式编辑等功能的出现表明,视频生成正从"创意激发工具"向"专业创作助手"转型。
-
尽管通义万相背靠阿里巴巴,技术实力和商业背景较为可靠,但作为 AI 内容生成工具,仍面临一些普遍性争议。 版权与内容安全是行业共同面临的问题。AI 生成的视频和图像可能涉及版权素材的模仿或再现,在商业应用中需要谨慎评估法律风险。Wan 平台在用户协议中明确禁止生成侵权内容,但实际执行效果仍需观察。 生成内容的真实性风险同样值得关注。随着 AI 视频生成技术的普及,深伪(Deepfake)等问题日益突出。Wan 在技术层面采取了水印和溯源措施,但完全杜绝滥用仍是行业性挑战。 此外,AI 视频生成对传统影视内容创作者的冲击也引发了一些讨论。一方面,AIGC 工具降低了视频创作门槛,为更多普通人提供了表达渠道;另一方面,也有人担忧这会压缩专业创作者的生存空间。
-
通义万相 Wan 适合以下用户群体: 短视频创作者和自媒体博主可以利用文生视频和图生视频功能快速生成内容素材,尤其适合知识讲解、产品展示、生活记录等场景。电商从业者可借助虚拟模特和图像编辑功能制作商品展示图和宣传视频,降低拍摄成本。AI 爱好者和开发者可以通过开源模型进行本地部署和二次开发,探索更多可能性。专业影视团队可以将 Wan 作为创意构思和粗剪阶段的辅助工具,用于快速验证想法。 对于预算有限或刚接触 AI 视频生成的用户,建议从免费额度开始体验,评估是否满足基本需求后再决定是否付费。有高频使用需求的企业用户可关注百炼平台的企业版套餐,通常能获得更优惠的价格和技术支持。 替代方案方面,如果对视频质量有更高要求且预算充足,可考虑 Runway、Pika 等国际产品;如果偏好本土化服务和中文支持,可关注可灵、海螺视频等同类型国产工具。
-
通义万相 Wan 是阿里巴巴在 AI 视频生成领域的重要布局,凭借开源策略、持续迭代的技术能力和阿里云生态的支撑,已成为国产 AIGC 工具的代表性产品。最新 Wan 2.7 在思考模式、多图合成、指令式编辑等维度实现创新突破,将视频创作的控制粒度提升到新水平。对于中文用户和国内企业而言,Wan 是一个值得优先考虑的选择。随着多模态融合趋势的深入和精细化控制需求的增长,Wan 系列的技术路线与产品策略契合度较高,未来发展值得持续关注。
用户评论
-
Michael.Ward369070—本地部署真香,开源免费随便造。 -
KAlar—Wan2.2 的中文理解确实碾压海外开源模型,古风市井提示词直接落地,不用翻译来翻译去。 -
Benjamin_Chavez_Max4—用 1.3B 轻量版在 3060 上跑,8G 显存就能出 480P,几秒钟一段。做小红书草稿足够用了,画质一般但胜在快。 -
PStephens_20212—折腾两天把 Wan2.2-A14B 的 MoE 版在 4090 上跑起来了,24G 显存刚好。实测风景和抽象艺术是真的能打,光影过渡自然,比可灵免费档强太多。但复杂多人互动偶尔有漂浮感,流体布料还是差点意思,长镜头得分段拼接。开源 Apache2.0 这点太关键,随便微调 LoRA 接单都没版权风险。 -
KKimX—720P 封顶,想要 4K 的还是老老实实上可灵吧。 -
HOrtizX—通义万相 app 的 Wan2.7 生图是真香,终于不千人一面了,还能锁 HEX 色号精准控色,做电商主图省了好多返工。局部重绘也省事,给古风人物加把剑不用整张重跑。就是免费灵感值不够造,高频使用还是得充值,对普通个人创作者成本稍高。 -
Christian_Allen_2022—首尾帧串联这个功能救我狗命,画个开头结尾 AI 自动补中间,科普短片一下就出来。 -
rqqcgf—拿 Wan2.2 跟 Kling 3.0 免费档同提示词对比过,风景构图打平,人物运动可灵稍顺一点,但 Wan 的抽象艺术更有意思,而且完全免费本地随便跑不限次数。对预算有限的个人创作者,Wan 就是开源视频首选,ComfyUI 节点也最全。唯一糟心是英文文档居多,官方中文文档更新慢半拍。 -
Grace_Morris_2023—虚拟模特模板真适合电商,上传衣服图直接出不同肤色模特的棚拍图,中东市场物料不用真去沙漠重拍了。还能调头巾飘动细节,省下的重拍成本够买好几张卡。生成超过五张图要走企业账号报备,这点小麻烦。 -
JustinSanchezZ8—5B 版三秒出片,当创意速写本刚刚好。 -
JohnnyBailey_2023—14B 在消费级卡上跑一段十秒要二十分钟,绝不是实时,但架不住免费啊,睡觉挂着批量出。 -
SatsChasera76—太强了!刚试了Wan 2.7的首尾帧控制,出片效果完全超出预期 -
Paul.Reyes—阿里这次真的牛,270亿参数的MoE架构不是吹的,生成速度比之前快了不少 -
Ruth_NguyenQ—作为设计师真的太爱这个工具了!用它生成了好几套电商主图,客户反馈特别好 -
ASmithJr—思考模式有点意思,生成的视频真的有导演感,不像之前那种随机拼接的质感 -
DMurraySr468—1080P一秒一块钱说实话有点贵,但质量确实值这个价 -
4571_fq—用Wan 2.6做角色扮演功能,一个人演对手戏的感觉太爽了,完全停不下来 -
NInie_dev—免费50张图+50秒视频对于新手体验来说足够了,90天期限也挺良心 -
tpatevziq—说实话国产AI视频能做成这样真的很惊喜,跟Sora比也不差了,中文支持还更好 -
熊芳静—本地部署党福音!Wan 2.1开源模型8G显存就能跑,省了不少云服务费用 -
JacquelineWilliamsK47—写实人像比早期版本自然太多,AI感明显减少了,点赞 -
JeanneSchmitt—ComfyUI工作流用Wan2.2真的香,速度和质量兼顾,比官方工作流快不少 -
MeganHernandez—用了一段时间发现,多镜头叙事功能做知识科普类视频特别合适,自动分镜太省心了 -
Lydia_Moore_88—提示词技巧:镜头语言描述越具体越好用,比如加上'推轨镜头''特写''俯拍'这种词 -
Noah_RiveraK—高峰期生成速度确实会慢一些,建议避开晚上8-10点使用 -
ARogersZ—音画同步是真的牛批!生成的视频里BGM和画面节奏完全卡点,不用再手动对轨了 -
Kenneth.Hall_749—Wan 2.7指令式编辑好评!换背景、调光线这种简单需求直接文字描述就行,不用重新生成 -
AliBeşok—九宫格多图合成功能太创意了,把9张素材拼接成连贯视频,抖音内容创作利器 -
NicoleBarnes520—之前一直用Runway,现在发现Wan的中文理解能力更强,提示词不用反复调 -
Alexander6_46—薅羊毛的快乐!阿里云百炼新用户90天免费额度,文生图文生视频都能用,还要啥自行车