通義萬相 Wan

阿里巴巴通義實驗室推出的AI創意平臺,支援文生圖、圖生圖、文生影片、圖生影片及影象編輯

深度報告

  • 通義萬相 Wan 是阿里巴巴通義實驗室推出的 AI 創意生成平臺,涵蓋文生圖、圖生圖、文生影片、圖生影片及影象編輯等核心能力。作為國產AI影片生成領域的頭部產品,Wan 系列憑藉開源策略、270億引數混合專家架構和原生多模態能力,在全球 AI 影片生成賽道中佔據重要地位。2026年4月最新發布的 Wan 2.7 更打出"讓影片像文件一樣可編輯"的定位,透過思考模式、首末幀控制、九宮格多圖合成等創新功能,將影片創作從"抽卡式生成"推向"精準導演"的新階段。

  • 通義萬相隸屬於阿里巴巴"通義"大模型產品矩陣,與通義千問、通義聽悟等構成阿里雲在大模型時代的內容生成生態。該產品最早於2023年7月在世界人工智慧大會上開啟定向邀測,主打 AI 繪畫創作功能。經過近三年迭代,Wan 已從單一的影象生成工具演進為覆蓋影象、影片、3D 模型的全棧 AIGC 平臺。 從開源策略來看,阿里巴巴採取了相對開放的態度。2025年2月25日釋出的 Wan 2.1 曾在釋出次日即宣佈開源,供全球學術、研究和商業機構使用。2025年3月26日,阿里團隊發表學術論文《Wan: Open and Advanced Large-Scale Video Generative Models》,公開了完整的技術架構和訓練細節,其中14B引數高效能版本基於數十億級圖片和影片資料集訓練,1.3B輕量級版本僅需8.19GB視訊記憶體即可在消費級 GPU 上執行。這一開源策略幫助 Wan 在全球開發者社群中建立了良好口碑。 從公司戰略角度看,通義萬相是阿里雲"百鍊"大模型服務平臺的核心能力之一,使用者可透過百鍊平臺直接呼叫 API,將 Wan 的生成能力整合到各類應用中。

  • 通義萬相 Wan 提供的功能可分為四大類別: 影象生成方面,平臺支援文生圖(text-to-image)、圖生圖(image-to-image)、草圖生圖(sketch-to-image)三種主要模式,並內建風格遷移、影象分割、超解析度、智慧編輯等影象編輯工具。使用者可以透過簡單的文字描述生成高質量圖片,也可以上傳現有圖片進行風格轉換或內容替換。 影片生成方面,Wan 是其核心競爭力所在。支援文生影片(text-to-video)和圖生影片(image-to-video)兩大基礎能力,最新一代 Wan 2.7 基於270億引數混合專家架構,可生成最高1080P解析度、24fps 的高畫質影片,每次生成時長2至15秒。 其他擴充套件功能包括虛擬模特(virtual_model)、文字藝術圖片、AI 音樂生成(text_to_music)、卡通頭像等,覆蓋了從商業設計到個人娛樂的多元場景。 Wan 2.7 核心升級: 2026年4月釋出的 Wan 2.7 帶來了六項關鍵功能升級: 思考模式是最大亮點之一。在渲染畫面之前,模型會先理解使用者提示詞並規劃構圖、鏡頭運動與敘事節奏,生成的影片更具"導演刻意編排"的觀感,而非隨機元素拼接。 首末幀控制功能支援同時鎖定影片的起始幀和結束幀,由模型自動推演中間過渡過程,適用於變形轉場、劇情匹配剪輯和分鏡驅動製作。 九宮格多圖合成最多支援上傳9張參考圖,將其拼接為一段連續影片,每張圖作為獨立場景並實現場景間的平滑過渡。 主體與聲音參考功能允許使用者上傳人物、物品或角色的參考圖,並可疊加聲音樣本,確保整段影片中角色外觀與聲線保持高度一致。 原生音訊同步在生成畫面的同時同步生成背景音樂、環境音效與人物對白,口型、動作節奏與音樂卡點天然對齊,無需後期手動混音。 指令式影片編輯支援使用自然語言描述修改需求,如更換背景、調整光線、更換服裝,模型會在保留原影片動作結構的前提下進行重繪。 與前代版本對比: 從 Wan 2.5 到 Wan 2.6 的迭代中,影片時長從10秒延長至15秒,實現了從單鏡頭表演到多鏡頭敘事的能力跨越,新增的智慧分鏡功能可自動將提示詞轉化為專業分鏡指令碼。Wan 2.7 則在此基礎上引入 MoE 架構和思考模式,實現了從"執行者"到"導演"的角色升級。

  • 通義萬相 Wan 採用雲端 API 呼叫的計費模式,透過阿里雲百鍊平臺提供服務。 免費額度方面,開通百鍊平臺後的90天內可享受一定額度的免費試用。具體免費權益包括:文生圖50張、影片類(文生影片、圖生影片)各50秒。 收費方面,按實際使用量計費:文生圖0.2元/張;文生影片和圖生影片的720P解析度版本0.6元/秒,1080P解析度版本1元/秒。這一價格定位在主流 AI 影片生成工具中處於中等偏下水平,具有一定競爭力。 對於有更高頻率使用需求的使用者,可考慮購買阿里雲百鍊平臺的資源包套餐或企業版服務。此外,Wan 系列部分模型(如 Wan 2.1)已開源,開發者可選擇本地部署使用,但本地部署對硬體配置有一定要求。

  • 從公開渠道收集的使用者反饋來看,通義萬相 Wan 的整體評價偏向正面。 正面評價主要集中在以下幾個方面:作為國產工具,中文支援體驗流暢,提示詞理解準確;開源模型本地部署降低了使用成本;生成的寫實人像較早期版本更加自然,"AI感"明顯減少;音畫同步能力在同類產品中處於領先水平;多鏡頭敘事功能獲得專業創作者的認可。 負面反饋和批評主要集中在:複雜場景下指令遵循能力仍有提升空間;部分使用者反映生成速度較慢,尤其在高峰期;1080P高畫質模式收費較高,長影片創作成本可觀;影片角色扮演功能在多角度切換時偶發形象失真問題。 從第三方評測機構的測試來看,有評測指出 Wan 2.7 的"底層生成能力"與"上層編輯功能"之間存在一定落差——複雜的編輯功能對底層生成質量提出更高要求,當底層生成存在瑕疵時,編輯效果也會受到影響。

  • 在 AI 影片生成賽道,通義萬相 Wan 的主要競爭對手包括 OpenAI Sora、Runway Gen-3、Pika、Luma Dream Machine、可靈(Kling)、海螺影片等。從2026年的競爭格局來看,Wan 系列憑藉開源策略和本土化優勢,在中文市場具有較強的使用者基礎和品牌認知。 在 Artificial Analysis 等第三方評測榜單上,Wan 2.7 與 HappyHorse 1.0 等新興模型形成激烈競爭。有分析認為,Wan 在技術指標上已接近國際第一梯隊,但在產品化體驗和商業化生態方面仍有追趕空間。 從行業趨勢看,多模態融合(影片+音訊+文字)已成為頭部產品的共識方向,Wan 2.7 原生音訊同步功能的強化正是順應這一趨勢。另一個顯著趨勢是精細化控制能力的增強,首末幀控制、指令式編輯等功能的出現表明,影片生成正從"創意激發工具"向"專業創作助手"轉型。

  • 儘管通義萬相背靠阿里巴巴,技術實力和商業背景較為可靠,但作為 AI 內容生成工具,仍面臨一些普遍性爭議。 版權與內容安全是行業共同面臨的問題。AI 生成的影片和影象可能涉及版權素材的模仿或再現,在商業應用中需要謹慎評估法律風險。Wan 平臺在使用者協議中明確禁止生成侵權內容,但實際執行效果仍需觀察。 生成內容的真實性風險同樣值得關注。隨著 AI 影片生成技術的普及,深偽(Deepfake)等問題日益突出。Wan 在技術層面採取了水印和溯源措施,但完全杜絕濫用仍是行業性挑戰。 此外,AI 影片生成對傳統影視內容創作者的衝擊也引發了一些討論。一方面,AIGC 工具降低了影片創作門檻,為更多普通人提供了表達渠道;另一方面,也有人擔憂這會壓縮專業創作者的生存空間。

  • 通義萬相 Wan 適合以下使用者群體: 短影片創作者和自媒體博主可以利用文生影片和圖生影片功能快速生成內容素材,尤其適合知識講解、產品展示、生活記錄等場景。電商從業者可藉助虛擬模特和影象編輯功能製作商品展示圖和宣傳影片,降低拍攝成本。AI 愛好者和開發者可以透過開源模型進行本地部署和二次開發,探索更多可能性。專業影視團隊可以將 Wan 作為創意構思和粗剪階段的輔助工具,用於快速驗證想法。 對於預算有限或剛接觸 AI 影片生成的使用者,建議從免費額度開始體驗,評估是否滿足基本需求後再決定是否付費。有高頻使用需求的企業使用者可關注百鍊平臺的企業版套餐,通常能獲得更優惠的價格和技術支援。 替代方案方面,如果對影片質量有更高要求且預算充足,可考慮 Runway、Pika 等國際產品;如果偏好本土化服務和中文支援,可關注可靈、海螺影片等同型別國產工具。

  • 通義萬相 Wan 是阿里巴巴在 AI 影片生成領域的重要佈局,憑藉開源策略、持續迭代的技術能力和阿里雲生態的支撐,已成為國產 AIGC 工具的代表性產品。最新 Wan 2.7 在思考模式、多圖合成、指令式編輯等維度實現創新突破,將影片創作的控制粒度提升到新水平。對於中文使用者和國內企業而言,Wan 是一個值得優先考慮的選擇。隨著多模態融合趨勢的深入和精細化控制需求的增長,Wan 系列的技術路線與產品策略契合度較高,未來發展值得持續關注。

使用者評論

  • 頭像
    Michael.Ward369070
    本地部署真香,開源免費隨便造。

  • 頭像
    KAlar
    Wan2.2 的中文理解確實碾壓海外開源模型,古風市井提示詞直接落地,不用翻譯來翻譯去。

  • 頭像
    Benjamin_Chavez_Max4
    用 1.3B 輕量版在 3060 上跑,8G 視訊記憶體就能出 480P,幾秒鐘一段。做小紅書草稿足夠用了,畫質一般但勝在快。

  • 頭像
    PStephens_20212
    折騰兩天把 Wan2.2-A14B 的 MoE 版在 4090 上跑起來了,24G 視訊記憶體剛好。實測風景和抽象藝術是真的能打,光影過渡自然,比可靈免費檔強太多。但複雜多人互動偶爾有漂浮感,流體布料還是差點意思,長鏡頭得分段拼接。開源 Apache2.0 這點太關鍵,隨便微調 LoRA 接單都沒版權風險。

  • 頭像
    KKimX
    720P 封頂,想要 4K 的還是老老實實上可靈吧。

  • 頭像
    HOrtizX
    通義萬相 app 的 Wan2.7 生圖是真香,終於不千人一面了,還能鎖 HEX 色號精準控色,做電商主圖省了好多返工。區域性重繪也省事,給古風人物加把劍不用整張重跑。就是免費靈感值不夠造,高頻使用還是得充值,對普通個人創作者成本稍高。

  • 頭像
    Christian_Allen_2022
    首尾幀串聯這個功能救我狗命,畫個開頭結尾 AI 自動補中間,科普短片一下就出來。

  • 頭像
    rqqcgf
    拿 Wan2.2 跟 Kling 3.0 免費檔同提示詞對比過,風景構圖打平,人物運動可靈稍順一點,但 Wan 的抽象藝術更有意思,而且完全免費本地隨便跑不限次數。對預算有限的個人創作者,Wan 就是開源影片首選,ComfyUI 節點也最全。唯一糟心是英文文件居多,官方中文文件更新慢半拍。

  • 頭像
    Grace_Morris_2023
    虛擬模特模板真適合電商,上傳衣服圖直接出不同膚色模特的棚拍圖,中東市場物料不用真去沙漠重拍了。還能調頭巾飄動細節,省下的重拍成本夠買好幾張卡。生成超過五張圖要走企業賬號報備,這點小麻煩。

  • 頭像
    JustinSanchezZ8
    5B 版三秒出片,當創意速寫本剛剛好。

  • 頭像
    JohnnyBailey_2023
    14B 在消費級卡上跑一段十秒要二十分鐘,絕不是實時,但架不住免費啊,睡覺掛著批次出。

  • 頭像
    SatsChasera76
    太強了!剛試了Wan 2.7的首尾幀控制,出片效果完全超出預期

  • 頭像
    Paul.Reyes
    阿里這次真的牛,270億引數的MoE架構不是吹的,生成速度比之前快了不少

  • 頭像
    Ruth_NguyenQ
    作為設計師真的太愛這個工具了!用它生成了好幾套電商主圖,客戶反饋特別好

  • 頭像
    ASmithJr
    思考模式有點意思,生成的影片真的有導演感,不像之前那種隨機拼接的質感

  • 頭像
    DMurraySr468
    1080P一秒一塊錢說實話有點貴,但質量確實值這個價

  • 頭像
    4571_fq
    用Wan 2.6做角色扮演功能,一個人演對手戲的感覺太爽了,完全停不下來

  • 頭像
    NInie_dev
    免費50張圖+50秒影片對於新手體驗來說足夠了,90天期限也挺良心

  • 頭像
    tpatevziq
    說實話國產AI影片能做成這樣真的很驚喜,跟Sora比也不差了,中文支援還更好

  • 頭像
    熊芳靜
    本地部署黨福音!Wan 2.1開源模型8G視訊記憶體就能跑,省了不少雲服務費用

  • 頭像
    JacquelineWilliamsK47
    寫實人像比早期版本自然太多,AI感明顯減少了,點贊

  • 頭像
    JeanneSchmitt
    ComfyUI工作流用Wan2.2真的香,速度和質量兼顧,比官方工作流快不少

  • 頭像
    MeganHernandez
    用了一段時間發現,多鏡頭敘事功能做知識科普類影片特別合適,自動分鏡太省心了

  • 頭像
    Lydia_Moore_88
    提示詞技巧:鏡頭語言描述越具體越好用,比如加上'推軌鏡頭''特寫''俯拍'這種詞

  • 頭像
    Noah_RiveraK
    高峰期生成速度確實會慢一些,建議避開晚上8-10點使用

  • 頭像
    ARogersZ
    音畫同步是真的牛批!生成的影片裡BGM和畫面節奏完全卡點,不用再手動對軌了

  • 頭像
    Kenneth.Hall_749
    Wan 2.7指令式編輯好評!換背景、調光線這種簡單需求直接文字描述就行,不用重新生成

  • 頭像
    AliBeşok
    九宮格多圖合成功能太創意了,把9張素材拼接成連貫影片,抖音內容創作利器

  • 頭像
    NicoleBarnes520
    之前一直用Runway,現在發現Wan的中文理解能力更強,提示詞不用反覆調

  • 頭像
    Alexander6_46
    薅羊毛的快樂!阿里雲百鍊新使用者90天免費額度,文生圖文生影片都能用,還要啥腳踏車