阿里千问发布Qwen-Image-3.0:支持4.5k超长输入的多模态突破

国产图像生成模型再进化

2026-07-26 22:30

阿里在图像生成领域又往前迈了一大步。

7月26日,阿里巴巴正式发布千问图像生成与编辑模型系列的第三代基础模型Qwen-Image-3.0。和上一代相比,这次最大的亮点是支持最大4.5k token的超长输入。这个数字意味着模型可以一次性理解并生成包含复杂公式符号、几何图形、逻辑推导步骤的多元素融合的知识图解,以及复杂的UI界面。

对于做技术内容创作的人来说,这是一个很实在的进步。过去你想让AI画一张带数学公式的知识图谱,大概率需要在输入阶段反复调整,甚至分多次生成再手动拼接。现在Qwen-Image-3.0可以一次性理解完整逻辑链条,直接输出成品。

另一个值得关注的突破是它的多语言能力。

Qwen-Image-3.0支持12国语言和20多款字体的原生渲染。这意味着不管是中文海报、英文信息图还是日文排版,都可以直接在模型输出层完成,不需要后期再去适配字体。对于跨境电商和全球化内容团队来说,这能省下不少功夫。

从行业背景来看,这次发布也是阿里云在多模态AI赛道持续加码的信号。此前阿里云已发布了Qwen2.5系列语言模型和多款视觉模型,图像生成是打通「文生图、图生文、图文混合理解」全链路的关键一环。

过去一年,国内的AI图像生成赛道经历了从「能画出来」到「画得好」再到「能干活」的快速进化。Qwen-Image-3.0的发布,某种程度上代表了国产模型在教育、设计、内容创作等专业场景落地的加速。

对于普通用户来说最直接的感受可能是:以后用AI生成一张包含复杂图表和多种文字的海报,不需要来回折腾了,一句话丢过去结果直接出来。 这大概就是AI进入实用阶段最朴素的样子。

实际上,图像生成模型正在经历一场从「玩具」到「工具」的身份转变。半年前大家还在比拼谁的图更逼真、更像照片,现在比拼的是谁能把复杂的排版、文字、图形一次搞定。这种从「好看」到「好用」的转变,才是Qwen-Image-3.0真正的行业意义所在。