阿里千問釋出Qwen-Image-3.0:支援4.5k超長輸入的多模態突破

國產影象生成模型再進化

2026-07-26 22:30

阿里在影象生成領域又往前邁了一大步。

7月26日,阿里巴巴正式釋出千問影象生成與編輯模型系列的第三代基礎模型Qwen-Image-3.0。和上一代相比,這次最大的亮點是支援最大4.5k token的超長輸入。這個數字意味著模型可以一次性理解並生成包含複雜公式符號、幾何圖形、邏輯推導步驟的多元素融合的知識圖解,以及複雜的UI介面。

對於做技術內容創作的人來說,這是一個很實在的進步。過去你想讓AI畫一張帶數學公式的知識圖譜,大機率需要在輸入階段反覆調整,甚至分多次生成再手動拼接。現在Qwen-Image-3.0可以一次性理解完整邏輯鏈條,直接輸出成品。

另一個值得關注的突破是它的多語言能力。

Qwen-Image-3.0支援12國語言和20多款字型的原生渲染。這意味著不管是中文海報、英文資訊圖還是日文排版,都可以直接在模型輸出層完成,不需要後期再去適配字型。對於跨境電商和全球化內容團隊來說,這能省下不少功夫。

從行業背景來看,這次釋出也是阿里雲在多模態AI賽道持續加碼的訊號。此前阿里雲已釋出了Qwen2.5系列語言模型和多款視覺模型,影象生成是打通「文生圖、圖生文、圖文混合理解」全鏈路的關鍵一環。

過去一年,國內的AI影象生成賽道經歷了從「能畫出來」到「畫得好」再到「能幹活」的快速進化。Qwen-Image-3.0的釋出,某種程度上代表了國產模型在教育、設計、內容創作等專業場景落地的加速。

對於普通使用者來說最直接的感受可能是:以後用AI生成一張包含複雜圖表和多種文字的海報,不需要來回折騰了,一句話丟過去結果直接出來。 這大概就是AI進入實用階段最樸素的樣子。

實際上,影象生成模型正在經歷一場從「玩具」到「工具」的身份轉變。半年前大家還在比拼誰的圖更逼真、更像照片,現在比拼的是誰能把複雜的排版、文字、圖形一次搞定。這種從「好看」到「好用」的轉變,才是Qwen-Image-3.0真正的行業意義所在。