阿里 Wan 2.6 开源视频

阿里通义万相2.6视觉生成模型,国内首个支持角色扮演的AI视频模型,可生成15秒多镜头声画同步视频

深度报告

  • 万相2.6是阿里巴巴在2025年12月16日发布的新一代视觉生成模型系列,涵盖文生视频、图生视频、参考生视频、图像生成、文生图五个模型,主打「影视级」专业创作能力。它最大的亮点是国内首个支持「角色扮演」的视频模型:上传一段参考视频,模型能学习其中人物的长相和音色,再按提示词生成这个人的全新表演,还能做单人、多人乃至人与物的合拍。此外它把单次视频时长拉到15秒,支持多镜头智能分镜、声画同步和音频驱动,对标的正是OpenAI的Sora2。需要提醒的是,尽管万相家族以「开源」闻名,但公开可下载的权重实际上停在2.1/2.2版本(Apache 2.0),而带音频、带1080P的2.5/2.6版本目前主要以API和App形式提供,「Wan 2.6开源」这个说法存在争议,下文会专门说明。

  • 万相(英文Wan,通义万相)是阿里云旗下的视觉生成模型家族,团队在杭州,隶属阿里巴巴集团。这个家族从2025年2月开始走开源路线,万相2.1把14B和1.3B两个规格的推理代码和权重按Apache 2.0协议全部开源,一度成为社区里最受欢迎的开源视频模型之一。到2025年8月,Wan系列在GitHub上拿到超过1.3万star,模型累计下载超过350万次;官方口径里,整个万相家族已支持文生图、文生视频、图生视频、人声生视频、动作生成等十多种能力,累计生成约3.9亿张图片、7000万个视频,自2月以来连续开源二十多款模型,第三方平台下载量超过3000万。 万相2.6的发布节奏卡在一个关键时点上。2025年9月云栖大会阿里发了万相2.5 preview,首次实现音画同步,视频从5秒拉到10秒、支持24帧1080P。11月17日阿里把「通义」App正式改名「千问」App,全力进军面向消费者的市场。12月16日万相2.6随千问App一起上线,并向所有用户免费开放。千问App的势头很猛:公测一周下载破千万,23天月活(含App、Web、PC端)突破3000万,被称为全球增长最快的AI应用之一;一个月内更新18个版本。阿里还专门成立了千问C端事业群,目标是把千问做成AI时代用户的「第一入口」。万相2.6就是这场豪赌里的重要一块拼图。

  • 核心卖点是角色扮演(对应模型Wan2.6-R2V,参考生视频)。用户丢进去一段2到30秒、主体清晰、有声音的参考视频,模型会把里面角色的外观和音色都学下来,再按提示词让这个角色去演你写的剧本,可以是单人表演,也可以最多三个角色合拍对话。这项能力被官方称作「国内首个」,而且据称是Sora2尚未完全实现的方向。千问App基于它上线了「AI小剧场」,国内首次实现「角色合拍」——你能和苏轼、和美国队长同框演一段短视频,生成后一键分享到微信、朋友圈、QQ。 第二个亮点是智能分镜叙事。你只要写一句大致描述,模型会自动把它拆成多镜头脚本,特写管眼神、中景管动作、全景管环境,并在镜头切换时保持角色、服装、情绪、场景一致。想更精细控制的话,可以用「总体描述+镜头序号+时间戳+分镜内容」的公式化写法,逐个镜头指定内容,还支持数十种基础运镜和组合运镜。 第三是15秒长视频加声画同步。相比前代碎片化的动作片段,2.6能生成有入场、互动、离场的完整叙事结构,角色不只是动嘴,还能带情绪说话,口型精准匹配,支持多人自然对话,音效和音乐质感也做了提升。它甚至支持音频驱动生成——你给一段文本和音频,模型据此驱动画面和多镜头演绎,这一点被认为走在了Sora2前面。 图像侧同样做了升级:多图融合与创意重组、商用级主体一致性、美学要素迁移、镜头与光线精准控制,以及图文混排输出(一次生成多张图配文字,具备一定逻辑推理,适合绘本、说明、信息图)。文生图则强调艺术风格的可控性、真实人像质感和中英文长文本的文字生成能力,能做海报、图表、插画。 实际体验上口碑分化。第三方托管平台形容其画质出色、指令遵循强、运动质量接近Google Veo 3.1;但也有媒体实测发现,遇到复杂或超现实的提示词(比如「孙悟空和财神拥抱」)模型理解会跑偏,给出前后不搭的画面。生成速度方面,千问App里翻拍一段10秒视频大约要2到5分钟,API方式生成通常也要等5分钟以上。

  • 万相2.6走的是「App免费引流+云端API变现」的双轨模式。普通用户在千问App里可以免费用,这是拉新和留存的入口。开发者和企业则通过阿里云百炼平台调API付费。价格按视频时长和分辨率计费:文生视频、图生视频、参考生视频都是720P每秒0.6元、1080P每秒1元,固定30fps、MP4(H.264)输出。开通阿里云百炼后有50秒免费额度,有效期90天。文生视频和图生视频支持5/10/15秒,参考生视频目前支持5/10秒。值得注意的是,参考生视频(R2V)在百炼上还不支持网页体验,只能通过API调用。 第三方海外聚合平台给出的报价大致是每秒0.10美元、或每条视频约1美元的标准档,和国内官方定价基本对得上。整体定价在同级模型里偏中等偏实惠,尤其考虑到它自带音频和1080P。

  • 正面评价集中在几点:一是角色一致性和「Replace/替换」能力被社区认为是同类里的标杆,能在保留原片运镜和光线的前提下换角色,这是过去只有高端特效公司才做得到的;二是性价比高,自带音频、1080P、15秒时长,价格却不贵;三是对开源生态友好,愿意自建GPU的团队可以基于开源权重做微调和LoRA,避免被单一厂商锁定。有第三方评测把2.6的VBench分数标到84.7%,在开源DiT视频模型里属于第一梯队。 负面反馈也不少:一是文档在中英文之间比较割裂,最深入的技术细节往往只在中文论坛里,海外开发者要花额外精力翻译;二是自建门槛高,14B模型自托管建议24GB以上显存,全套权重加VAE要预留100GB磁盘;三是海外API延迟偏高,国际开发者容易碰到连接超时,需要正确设置endpoint和API Key;四是复杂提示词下的指令理解仍有短板。还有独立评测直言,目前所有「质量很好」的说法都来自托管平台自己,缺少独立的ELO排名和第三方基准验证。

  • 媒体和机构普遍把万相2.6放在中美AI视频生成竞赛的框架里看。招商证券统计业内已有15个以上被广泛认可的视频模型,竞争白热化。华泰证券认为Sora2的突破更多在于配套的AI社交平台,通过双边网络效应自我强化。工信部专家盘和林对每日经济新闻表示,中国在算法能力上相对较强,阿里有丰富的数据和算力储备,性能上能无限接近Sora2,当前差距主要在生成细节;他同时认为千问、即梦、可灵基本处在同一起跑线。 竞争格局确实拥挤:同在12月16日,字节即梦AI网页版升级成「AI片场」,主打视频3.5 Pro的音视频同出;快手可灵AI推出2.6模型,具备「音画同出」,最长10秒。海外方面,Seedance 2.0、Minimax海螺02、Google Veo 3.1、OpenAI Sora2都是强劲对手——某2026年榜单里Seedance 2.0以4.70分居首,万相2.6以4.41分排在中游,评价是「开源可自托管是它区别于闭源对手的核心武器」。市场空间很大:Grand View Horizon预计2025年全球AI视频生成市场约8亿美元,长期可触达市场接近400亿美元,其中B端占九成。

  • 最需要说清楚的是「开源」这个标签。万相家族确实以开源著称,但公开可下载、可商用的权重实际停在2.1/2.2版本(Apache 2.0);而带原生音频、1080P的2.5及以后版本,多个独立来源指出是「闭源/仅API」提供。也就是说,「Wan 2.6开源视频」这个叫法并不完全准确——你能免费自托管的是2.2,能用到2.6全部能力(音频、15秒、角色扮演)主要得走API或千问App。不过也有部分聚合站点声称2.6权重已上HuggingFace(Wan-AI组织)和GitHub(Wan-Video),信息互相矛盾,采用前务必到官方仓库核实当前实际放出的版本和授权条款。 其他风险包括:一是同质化竞争激烈,即梦、可灵、海螺、Veo、Sora2各有所长,模型能力差距正在被抹平,长期比拼的是生态和用户洞察,不只是参数;二是留存隐忧,a16z合伙人爆料Sora这类AI视频社交应用早期留存很弱(1天10%、30天1%、60天0%),说明「好玩」能拉新但未必留得住人,千问的AI小剧场同样要面对这个问题;三是生成可控性,复杂提示词下理解跑偏、生成需等待数分钟,离「一键出片」还有距离;四是合规与版权,角色扮演能把真人或名人放进AI视频,肖像权、深度伪造、内容审核都是绕不开的问题。

  • 适合三类人。一是短剧和短视频创作者,角色扮演加多镜头叙事能大幅压缩拍摄和后期成本,尤其适合需要角色一致性的连续剧情;二是电商和营销团队,图生视频加商用级主体一致性适合快速产出产品展示和广告素材,价格也扛得住高频使用;三是有GPU基础、追求可控和成本效率的工程团队,可以基于开源的2.2权重自托管、微调,搭建定制化的视频生成管线。 不太适合两类人:一是没有GPU集群、又想要纯「电影级」氛围叙事的用户,这方面Sora2在质感和氛围深度上仍占优;二是对稳定性和延迟要求极高的海外生产环境,需要提前测试endpoint和延迟。想尝鲜的普通用户,最省事的路径是直接下载千问App用「AI小剧场」,免费且门槛最低;开发者则从阿里云百炼申请API Key,先用免费额度跑通再上量。

  • 万相2.6是阿里在AI视频赛道对标Sora2的一次全面发力,角色扮演、多镜头叙事、声画同步、音频驱动这套组合拳让它成为目前功能最全的视频生成模型之一,加上千问App三千万月活的分发能力,短期声量和用户增长都很猛。它真正的护城河其实是开源生态(2.1/2.2权重)带来的可自托管、可微调,这是闭源对手给不了的。但要理性看待:一方面「2.6开源」的说法需要打个问号,全部能力目前主要在API和App里;另一方面视频生成已是红海,模型差距在收窄,能不能留住用户、把「好玩」变成「常用」,才是阿里这场豪赌真正的胜负手。

用户评论

  • 头像
    LLong
    角色扮演这个功能是真的强,上传自己一段视频,模型把长相和音色都学下来,再让我去演另一个剧本,口型跟台词严丝合缝,声音也没什么塑料AI味,这在以前得靠专业特效团队花好几天才做得到,现在几分钟就出来了,短剧和虚拟人直播这类商用场景实用性直接拉满。

  • 头像
    蔡哲玉
    导演型模型,不是剪辑型模型这句话总结得太到位了。你得自己把镜头1镜头2镜头3设计清楚,它才能发挥多机位优势,只想一键出片的还是别来。

  • 头像
    HAcha_fi
    免费用户最难受的就是等,五秒视频排队加生成感觉等了小半天,氪金应该会好很多吧。

  • 头像
    LisaJames_Max828
    音频驱动生视频这点确实是Sora2还没有的,我给一张正面图加一段自己录的快语速音频,一个提示词都不写,它自动就把口型、情绪节奏还有镜头切换全给我对上了,两个角色的音色区分度也很清楚,连贯性比我之前试过的同类方案稳太多,基本属于拿来就能直接发的水平。

  • 头像
    KyleHill_Max
    文生图这条线真没啥竞争力,AI感挺重的,相同提示词还不如豆包,视频倒是不错,主次分明吧。

  • 头像
    AltSeason170_eth
    15秒还是太短了,可灵都能60秒了。做长叙事只能分段生成再剪,全长15秒跑满的时候脸和物体还容易变形。

  • 头像
    BrittanyBanks
    实测了一圈,人脸变形的问题还在,我上传一段自己的短视频当角色参考,让他穿摄影马甲去泰山顶拍日出,结果视频里拍摄的方向直接反了,没按提示词来;第二次身份倒是保留住了,能认出是同一个人,但原本光滑的下巴莫名其妙长出一脸胡须,细节失真挺明显,离宣传里人人皆可做导演还有相当长一段路。

  • 头像
    熊洁海
    电影感是真的强,光影构图情绪表达明显比那些纯短视频感的模型高一档,做品牌片和叙事IP很合适。

  • 头像
    djc_edwx
    开源这块真得说清楚,能免费下下来自托管的其实是2.1和2.2,走的是Apache 2.0协议,但带音频、带1080P的2.5和2.6版本目前主要还是走API和千问App,网上好几个地方说2.6权重上了HuggingFace,信息互相打架,想自己部署的建议先去官方仓库确认实际放出的到底是哪个版本,别被开源俩字直接骗进去。

  • 头像
    林晨月
    千问App里的AI小剧场太好玩了,和苏轼合拍还能和美国队长同框,生成完一键甩微信群,朋友都问我怎么弄的。

  • 头像
    Sean611_fi
    价格算厚道的,720P六毛一秒、1080P一块一秒,自带音频和高清,比Sora2便宜多了。

  • 头像
    DrTorGranås_2024
    多人对话场景还是有点机械,角色扮演贴合原角色没问题,但多人同框偶尔会角色替换错配,两个人的脸串了。

  • 头像
    冬雪_15
    自托管门槛不低啊,14B模型建议24G显存起步,全套权重加VAE得留100G硬盘,我3060的12G只能最低画质将就跑,想舒服用至少得16G,追求满血画质就得24G,这配置要求跟2.5基本没差。

  • 头像
    فاطمه زهرامحمدخان
    现有的ComfyUI工作流基本无缝迁移,改个模型路径就行,节点和参数全都能用,这点很省心。

  • 头像
    Anthony_JohnsonX
    说实话2.6相比2.5更像是打磨了一下边角,运动连贯性和手部有改善,但不是那种脱胎换骨的大升级,稳步进步吧。

  • 头像
    blackfish154
    中文语义理解是真的顶,成语、古诗词还有那些中国特有的文化元素它都能拿捏,不用像用国外模型那样费劲去搞一长串英文提示词工程,我随手写句古风的描述它就能懂个八九不离十,这方面Runway那些国外竞品确实比不了,本土化优势太明显了。

  • 头像
    MCastilloX
    复杂互动还是会翻车,我让两个人打斗配合,偶尔就肢体纠缠缠一起了,简单场景没问题。

  • 头像
    ChainChaserJimenez
    参考生视频在百炼上还不支持网页体验,只能API调,想在控制台点点点体验一下的先别急。

  • 头像
    DRped
    文字生成依然是弱项,视频里的字别指望它,还是后期加吧,这个毛病从上一代就有。

  • 头像
    StephanieFoster_77
    跨片段的角色一致性还是老大难,同一个角色放到不同视频里就对不上了,只能靠训LoRA或者别的工具补救;单条片段内部的时序一致性这次倒是改善了不少,15秒跑下来主体不会糊成一团,算是有进步的地方。

  • 头像
    MichelleBarnes
    Pro订阅五美元一个月起,价格是同类里的地板了,就是那个credit积分体系有点绕,每条视频到底扣多少不够直观。

  • 头像
    St_akeWave
    英文文档比以前好了,但最深的技术细节还是得翻中文论坛,海外开发者用起来得费点翻译功夫。

  • 头像
    JSanchezZ
    智能分镜是真惊艳,按总体描述加镜头序号加时间戳加分镜内容那套公式写,模型会自动拆成远景、中景、特写,多镜头切换的时候主体、服装、场景都能保持一致,剪辑出来的成片很连贯,短视频剧情号和IP衍生内容用这个简直是降维打击。

  • 头像
    85mkkv0r40
    抽卡成本不低,出片也慢,不适合高频大批量带货测试,更像是做精品内容用的,追求量的还是选别的。

  • 头像
    菊花750
    五秒视频标准画质大概45秒出,速度在国产里算快的,连续跑二十次没崩没卡队列,稳定性可以。

  • 头像
    0wgfv6
    刚发布就冲去试了,音画同步已经是标配,分镜控制惊艳,就是多人互动还带点机械感,整体比想象中能打。