阿里 Wan 2.6 開源影片

阿里通義萬相2.6視覺生成模型,國內首個支援角色扮演的AI影片模型,可生成15秒多鏡頭聲畫同步影片

深度報告

  • 萬相2.6是阿里巴巴在2025年12月16日釋出的新一代視覺生成模型系列,涵蓋文生影片、圖生影片、參考生影片、影象生成、文生圖五個模型,主打「影視級」專業創作能力。它最大的亮點是國內首個支援「角色扮演」的影片模型:上傳一段參考影片,模型能學習其中人物的長相和音色,再按提示詞生成這個人的全新表演,還能做單人、多人乃至人與物的合拍。此外它把單次影片時長拉到15秒,支援多鏡頭智慧分鏡、聲畫同步和音訊驅動,對標的正是OpenAI的Sora2。需要提醒的是,儘管萬相家族以「開源」聞名,但公開可下載的權重實際上停在2.1/2.2版本(Apache 2.0),而帶音訊、帶1080P的2.5/2.6版本目前主要以API和App形式提供,「Wan 2.6開源」這個說法存在爭議,下文會專門說明。

  • 萬相(英文Wan,通義萬相)是阿里雲旗下的視覺生成模型家族,團隊在杭州,隸屬阿里巴巴集團。這個家族從2025年2月開始走開源路線,萬相2.1把14B和1.3B兩個規格的推理程式碼和權重按Apache 2.0協議全部開源,一度成為社群裡最受歡迎的開源影片模型之一。到2025年8月,Wan系列在GitHub上拿到超過1.3萬star,模型累計下載超過350萬次;官方口徑裡,整個萬相家族已支援文生圖、文生影片、圖生影片、人聲生影片、動作生成等十多種能力,累計生成約3.9億張圖片、7000萬個影片,自2月以來連續開源二十多款模型,第三方平臺下載量超過3000萬。 萬相2.6的釋出節奏卡在一個關鍵時點上。2025年9月雲棲大會阿里發了萬相2.5 preview,首次實現音畫同步,影片從5秒拉到10秒、支援24幀1080P。11月17日阿里把「通義」App正式改名「千問」App,全力進軍面向消費者的市場。12月16日萬相2.6隨千問App一起上線,並向所有使用者免費開放。千問App的勢頭很猛:公測一週下載破千萬,23天月活(含App、Web、PC端)突破3000萬,被稱為全球增長最快的AI應用之一;一個月內更新18個版本。阿里還專門成立了千問C端事業群,目標是把千問做成AI時代使用者的「第一入口」。萬相2.6就是這場豪賭裡的重要一塊拼圖。

  • 核心賣點是角色扮演(對應模型Wan2.6-R2V,參考生影片)。使用者丟進去一段2到30秒、主體清晰、有聲音的參考影片,模型會把裡面角色的外觀和音色都學下來,再按提示詞讓這個角色去演你寫的劇本,可以是單人表演,也可以最多三個角色合拍對話。這項能力被官方稱作「國內首個」,而且據稱是Sora2尚未完全實現的方向。千問App基於它上線了「AI小劇場」,國內首次實現「角色合拍」——你能和蘇軾、和美國隊長同框演一段短影片,生成後一鍵分享到微信、朋友圈、QQ。 第二個亮點是智慧分鏡敘事。你只要寫一句大致描述,模型會自動把它拆成多鏡頭指令碼,特寫管眼神、中景管動作、全景管環境,並在鏡頭切換時保持角色、服裝、情緒、場景一致。想更精細控制的話,可以用「總體描述+鏡頭序號+時間戳+分鏡內容」的公式化寫法,逐個鏡頭指定內容,還支援數十種基礎運鏡和組合運鏡。 第三是15秒長影片加聲畫同步。相比前代碎片化的動作片段,2.6能生成有入場、互動、離場的完整敘事結構,角色不只是動嘴,還能帶情緒說話,口型精準匹配,支援多人自然對話,音效和音樂質感也做了提升。它甚至支援音訊驅動生成——你給一段文字和音訊,模型據此驅動畫面和多鏡頭演繹,這一點被認為走在了Sora2前面。 影象側同樣做了升級:多圖融合與創意重組、商用級主體一致性、美學要素遷移、鏡頭與光線精準控制,以及圖文混排輸出(一次生成多張圖配文字,具備一定邏輯推理,適合繪本、說明、資訊圖)。文生圖則強調藝術風格的可控性、真實人像質感和中英文長文字的文字生成能力,能做海報、圖表、插畫。 實際體驗上口碑分化。第三方託管平臺形容其畫質出色、指令遵循強、運動質量接近Google Veo 3.1;但也有媒體實測發現,遇到複雜或超現實的提示詞(比如「孫悟空和財神擁抱」)模型理解會跑偏,給出前後不搭的畫面。生成速度方面,千問App裡翻拍一段10秒影片大約要2到5分鐘,API方式生成通常也要等5分鐘以上。

  • 萬相2.6走的是「App免費引流+雲端API變現」的雙軌模式。普通使用者在千問App裡可以免費用,這是拉新和留存的入口。開發者和企業則透過阿里雲百鍊平臺調API付費。價格按影片時長和解析度計費:文生影片、圖生影片、參考生影片都是720P每秒0.6元、1080P每秒1元,固定30fps、MP4(H.264)輸出。開通阿里雲百鍊後有50秒免費額度,有效期90天。文生影片和圖生影片支援5/10/15秒,參考生影片目前支援5/10秒。值得注意的是,參考生影片(R2V)在百鍊上還不支援網頁體驗,只能透過API呼叫。 第三方海外聚合平臺給出的報價大致是每秒0.10美元、或每條影片約1美元的標準檔,和國內官方定價基本對得上。整體定價在同級模型裡偏中等偏實惠,尤其考慮到它自帶音訊和1080P。

  • 正面評價集中在幾點:一是角色一致性和「Replace/替換」能力被社群認為是同類裡的標杆,能在保留原片運鏡和光線的前提下換角色,這是過去只有高階特效公司才做得到的;二是價效比高,自帶音訊、1080P、15秒時長,價格卻不貴;三是對開源生態友好,願意自建GPU的團隊可以基於開源權重做微調和LoRA,避免被單一廠商鎖定。有第三方評測把2.6的VBench分數標到84.7%,在開源DiT影片模型裡屬於第一梯隊。 負面反饋也不少:一是文件在中英文之間比較割裂,最深入的技術細節往往只在中文論壇裡,海外開發者要花額外精力翻譯;二是自建門檻高,14B模型自託管建議24GB以上視訊記憶體,全套權重加VAE要預留100GB磁碟;三是海外API延遲偏高,國際開發者容易碰到連線超時,需要正確設定endpoint和API Key;四是複雜提示詞下的指令理解仍有短板。還有獨立評測直言,目前所有「質量很好」的說法都來自託管平臺自己,缺少獨立的ELO排名和第三方基準驗證。

  • 媒體和機構普遍把萬相2.6放在中美AI影片生成競賽的框架裡看。招商證券統計業內已有15個以上被廣泛認可的影片模型,競爭白熱化。華泰證券認為Sora2的突破更多在於配套的AI社交平臺,透過雙邊網路效應自我強化。工信部專家盤和林對每日經濟新聞表示,中國在演算法能力上相對較強,阿里有豐富的資料和算力儲備,效能上能無限接近Sora2,當前差距主要在生成細節;他同時認為千問、即夢、可靈基本處在同一起跑線。 競爭格局確實擁擠:同在12月16日,位元組即夢AI網頁版升級成「AI片場」,主打影片3.5 Pro的音影片同出;快手可靈AI推出2.6模型,具備「音畫同出」,最長10秒。海外方面,Seedance 2.0、Minimax海螺02、Google Veo 3.1、OpenAI Sora2都是強勁對手——某2026年榜單裡Seedance 2.0以4.70分居首,萬相2.6以4.41分排在中游,評價是「開源可自託管是它區別於閉源對手的核心武器」。市場空間很大:Grand View Horizon預計2025年全球AI影片生成市場約8億美元,長期可觸達市場接近400億美元,其中B端佔九成。

  • 最需要說清楚的是「開源」這個標籤。萬相家族確實以開源著稱,但公開可下載、可商用的權重實際停在2.1/2.2版本(Apache 2.0);而帶原生音訊、1080P的2.5及以後版本,多個獨立來源指出是「閉源/僅API」提供。也就是說,「Wan 2.6開源影片」這個叫法並不完全準確——你能免費自託管的是2.2,能用到2.6全部能力(音訊、15秒、角色扮演)主要得走API或千問App。不過也有部分聚合站點聲稱2.6權重已上HuggingFace(Wan-AI組織)和GitHub(Wan-Video),資訊互相矛盾,採用前務必到官方倉庫核實當前實際放出的版本和授權條款。 其他風險包括:一是同質化競爭激烈,即夢、可靈、海螺、Veo、Sora2各有所長,模型能力差距正在被抹平,長期比拼的是生態和使用者洞察,不只是引數;二是留存隱憂,a16z合夥人爆料Sora這類AI影片社交應用早期留存很弱(1天10%、30天1%、60天0%),說明「好玩」能拉新但未必留得住人,千問的AI小劇場同樣要面對這個問題;三是生成可控性,複雜提示詞下理解跑偏、生成需等待數分鐘,離「一鍵出片」還有距離;四是合規與版權,角色扮演能把真人或名人放進AI影片,肖像權、深度偽造、內容稽核都是繞不開的問題。

  • 適合三類人。一是短劇和短影片創作者,角色扮演加多鏡頭敘事能大幅壓縮拍攝和後期成本,尤其適合需要角色一致性的連續劇情;二是電商和營銷團隊,圖生影片加商用級主體一致性適合快速產出產品展示和廣告素材,價格也扛得住高頻使用;三是有GPU基礎、追求可控和成本效率的工程團隊,可以基於開源的2.2權重自託管、微調,搭建定製化的影片生成管線。 不太適合兩類人:一是沒有GPU叢集、又想要純「電影級」氛圍敘事的使用者,這方面Sora2在質感和氛圍深度上仍佔優;二是對穩定性和延遲要求極高的海外生產環境,需要提前測試endpoint和延遲。想嚐鮮的普通使用者,最省事的路徑是直接下載千問App用「AI小劇場」,免費且門檻最低;開發者則從阿里雲百鍊申請API Key,先用免費額度跑通再上量。

  • 萬相2.6是阿里在AI影片賽道對標Sora2的一次全面發力,角色扮演、多鏡頭敘事、聲畫同步、音訊驅動這套組合拳讓它成為目前功能最全的影片生成模型之一,加上千問App三千萬月活的分發能力,短期聲量和使用者增長都很猛。它真正的護城河其實是開源生態(2.1/2.2權重)帶來的可自託管、可微調,這是閉源對手給不了的。但要理性看待:一方面「2.6開源」的說法需要打個問號,全部能力目前主要在API和App裡;另一方面影片生成已是紅海,模型差距在收窄,能不能留住使用者、把「好玩」變成「常用」,才是阿里這場豪賭真正的勝負手。

使用者評論

  • 頭像
    LLong
    角色扮演這個功能是真的強,上傳自己一段影片,模型把長相和音色都學下來,再讓我去演另一個劇本,口型跟臺詞嚴絲合縫,聲音也沒什麼塑膠AI味,這在以前得靠專業特效團隊花好幾天才做得到,現在幾分鐘就出來了,短劇和虛擬人直播這類商用場景實用性直接拉滿。

  • 頭像
    蔡哲玉
    導演型模型,不是剪輯型模型這句話總結得太到位了。你得自己把鏡頭1鏡頭2鏡頭3設計清楚,它才能發揮多機位優勢,只想一鍵出片的還是別來。

  • 頭像
    HAcha_fi
    免費使用者最難受的就是等,五秒影片排隊加生成感覺等了小半天,氪金應該會好很多吧。

  • 頭像
    LisaJames_Max828
    音訊驅動生影片這點確實是Sora2還沒有的,我給一張正面圖加一段自己錄的快語速音訊,一個提示詞都不寫,它自動就把口型、情緒節奏還有鏡頭切換全給我對上了,兩個角色的音色區分度也很清楚,連貫性比我之前試過的同類方案穩太多,基本屬於拿來就能直接發的水平。

  • 頭像
    KyleHill_Max
    文生圖這條線真沒啥競爭力,AI感挺重的,相同提示詞還不如豆包,影片倒是不錯,主次分明吧。

  • 頭像
    AltSeason170_eth
    15秒還是太短了,可靈都能60秒了。做長敘事只能分段生成再剪,全長15秒跑滿的時候臉和物體還容易變形。

  • 頭像
    BrittanyBanks
    實測了一圈,人臉變形的問題還在,我上傳一段自己的短影片當角色參考,讓他穿攝影馬甲去泰山頂拍日出,結果影片裡拍攝的方向直接反了,沒按提示詞來;第二次身份倒是保留住了,能認出是同一個人,但原本光滑的下巴莫名其妙長出一臉鬍鬚,細節失真挺明顯,離宣傳里人人皆可做導演還有相當長一段路。

  • 頭像
    熊潔海
    電影感是真的強,光影構圖情緒表達明顯比那些純短影片感的模型高一檔,做品牌片和敘事IP很合適。

  • 頭像
    djc_edwx
    開源這塊真得說清楚,能免費下下來自託管的其實是2.1和2.2,走的是Apache 2.0協議,但帶音訊、帶1080P的2.5和2.6版本目前主要還是走API和千問App,網上好幾個地方說2.6權重上了HuggingFace,資訊互相打架,想自己部署的建議先去官方倉庫確認實際放出的到底是哪個版本,別被開源倆字直接騙進去。

  • 頭像
    林晨月
    千問App裡的AI小劇場太好玩了,和蘇軾合拍還能和美國隊長同框,生成完一鍵甩微信群,朋友都問我怎麼弄的。

  • 頭像
    Sean611_fi
    價格算厚道的,720P六毛一秒、1080P一塊一秒,自帶音訊和高畫質,比Sora2便宜多了。

  • 頭像
    DrTorGranås_2024
    多人對話場景還是有點機械,角色扮演貼合原角色沒問題,但多人同框偶爾會角色替換錯配,兩個人的臉串了。

  • 頭像
    冬雪_15
    自託管門檻不低啊,14B模型建議24G視訊記憶體起步,全套權重加VAE得留100G硬碟,我3060的12G只能最低畫質將就跑,想舒服用至少得16G,追求滿血畫質就得24G,這配置要求跟2.5基本沒差。

  • 頭像
    فاطمه زهرامحمدخان
    現有的ComfyUI工作流基本無縫遷移,改個模型路徑就行,節點和引數全都能用,這點很省心。

  • 頭像
    Anthony_JohnsonX
    說實話2.6相比2.5更像是打磨了一下邊角,運動連貫性和手部有改善,但不是那種脫胎換骨的大升級,穩步進步吧。

  • 頭像
    blackfish154
    中文語義理解是真的頂,成語、古詩詞還有那些中國特有的文化元素它都能拿捏,不用像用國外模型那樣費勁去搞一長串英文提示詞工程,我隨手寫句古風的描述它就能懂個八九不離十,這方面Runway那些國外競品確實比不了,本土化優勢太明顯了。

  • 頭像
    MCastilloX
    複雜互動還是會翻車,我讓兩個人打鬥配合,偶爾就肢體糾纏纏一起了,簡單場景沒問題。

  • 頭像
    ChainChaserJimenez
    參考生影片在百鍊上還不支援網頁體驗,只能API調,想在控制檯點點點體驗一下的先別急。

  • 頭像
    DRped
    文字生成依然是弱項,影片裡的字別指望它,還是後期加吧,這個毛病從上一代就有。

  • 頭像
    StephanieFoster_77
    跨片段的角色一致性還是老大難,同一個角色放到不同影片裡就對不上了,只能靠訓LoRA或者別的工具補救;單條片段內部的時序一致性這次倒是改善了不少,15秒跑下來主體不會糊成一團,算是有進步的地方。

  • 頭像
    MichelleBarnes
    Pro訂閱五美元一個月起,價格是同類裡的地板了,就是那個credit積分體系有點繞,每條影片到底扣多少不夠直觀。

  • 頭像
    St_akeWave
    英文文件比以前好了,但最深的技術細節還是得翻中文論壇,海外開發者用起來得費點翻譯功夫。

  • 頭像
    JSanchezZ
    智慧分鏡是真驚豔,按總體描述加鏡頭序號加時間戳加分鏡內容那套公式寫,模型會自動拆成遠景、中景、特寫,多鏡頭切換的時候主體、服裝、場景都能保持一致,剪輯出來的成片很連貫,短影片劇情號和IP衍生內容用這個簡直是降維打擊。

  • 頭像
    85mkkv0r40
    抽卡成本不低,出片也慢,不適合高頻大批次帶貨測試,更像是做精品內容用的,追求量的還是選別的。

  • 頭像
    菊花750
    五秒影片標準畫質大概45秒出,速度在國產裡算快的,連續跑二十次沒崩沒卡佇列,穩定性可以。

  • 頭像
    0wgfv6
    剛釋出就衝去試了,音畫同步已經是標配,分鏡控制驚豔,就是多人互動還帶點機械感,整體比想象中能打。