DALL-E 4 工作室

OpenAI 以 GPT Image 体系打造的 ChatGPT 内置图像工作室,长板在文字渲染与对话式一致编辑

深度报告

  • 「DALL-E 4 工作室」并非 OpenAI 官方发布的产品名称。截至 2026 年 7 月,OpenAI 从未正式宣布过「DALL-E 4」;其图像生成能力早已从 DALL·E 品牌转向「GPT Image」体系(gpt-image-1 / gpt-image-1.5),并作为「随身创意工作室」内嵌在 ChatGPT 中。本报告以确证事实为基座撰写,并明确标注「DALL-E 4」属信息流命名口径、尚无官方背书。

  • OpenAI 的文生图始于 2021 年的 DALL·E 1,经 DALL·E 2(2022)、DALL·E 3(2023,深度集成 ChatGPT)演进。2025 年 3 月底,ChatGPT 上线全新图像生成功能,凭借吉卜力风格和「AI 玩偶」迅速走红,首周超 1.3 亿用户生成超 7 亿张图。同年 4 月,OpenAI 将该能力以 gpt-image-1 模型开放 API。进入 2026 年,官方进一步推出 gpt-image-1.5 与全新「图像」专区,把 ChatGPT 定位为「随身创意工作室」。DALL·E 3 在 2026 年初被官方弃用,新功能与训练全部转向 GPT Image 体系。

  • 当前官方图像引擎的核心能力包括:原生文字渲染(可在图内准确生成多词标语、招牌、UI 文案,中文也已可用)、对话式多轮编辑(在同一会话里「把背景换成日落」「给产品加个 logo」,逐次叠加不重来)、参考图编辑(上传图片做局部重绘、换背景、风格迁移,并保留人物相貌等关键信息)、透明背景输出,以及 C2PA 元数据水印。新版模型生成速度提升多达 4 倍。这些能力共同构成了日常所说的「图像工作室」体验。

  • 面向个人,ChatGPT 免费档每日有有限生成次数,Plus 档 20 美元/月可较充分地使用图像功能,Pro 档更高。面向开发者,gpt-image-1 按 token 计费:文本输入每百万 token 5 美元、图像输入 10 美元、图像输出 40 美元,折合低 / 中 / 高质量方形图约每张 2 / 7 / 19 美分。已落地的企业包括 Adobe、Canva、Figma、Wix、Instacart、GoDaddy 等。

  • 正面来看,用户普遍认可其文字渲染的飞跃——过去 DALL·E 3 画中文几乎鬼画符,现在招牌文字清晰可读;对话式迭代让非专业用户也能边聊边改。开发者则看重透明背景与同端点生成加编辑,电商抠图换背景「一个 API 调用搞定」。负面声音集中在:高画质生成偏慢(high 档约 10 至 15 秒);中文长 prompt 偶发文字错误;并发受限明显,批量需自行做队列;并且命名混乱——用户搜「DALL-E 4」却实际用的是 GPT Image 1,造成预期落差。

  • 行业共识是 OpenAI 已用 GPT Image 体系取代 DALL·E 品牌。在指令遵循与文字渲染上,gpt-image-1 被认为明显优于 DALL·E 3,与 Midjourney、FLUX 等相比,强项在「对话上下文加一致编辑」,弱项在极致艺术审美与开源灵活度。多方评测指出,所谓「DALL-E 4」并不存在,真正驱动 2026 年 ChatGPT 图像的是 GPT Image 1 / 1.5。

  • 一是命名与预期管理:把未官宣的「DALL-E 4」当作已发布产品传播,容易误导用户。二是版权与合规:图像生成延续 DALL·E 3 的内容安全策略,限制生成公众人物与侵权风格,并为每张图打 C2PA 水印;但深度伪造、风格模仿仍存争议。三是集中度风险:能力完全锁在 ChatGPT 与 OpenAI API 内,企业依赖单一供应商。部分第三方测评声称的「4K 分辨率、30 秒视频生成」等能力,目前无 OpenAI 官方佐证,应视为传闻。

  • 适合需要快速出营销图、电商主图、UI 素材、概念草图,且希望「边聊边改」的创作者与团队;开发者可经 API 接入生产流程。对追求极致艺术风格、开源可控或视频生成的用户,Midjourney、FLUX、Sora 等仍是更对口的选择。建议把「DALL-E 4 工作室」理解为 ChatGPT 内的 GPT Image 创意工作流,而非等待中的独立产品。

  • 「DALL-E 4 工作室」实质是 OpenAI 以 GPT Image 体系打造的 ChatGPT 内置图像工作室;其长板在文字渲染与对话式一致编辑,硬伤在生成速度、命名混乱与第三方夸大的传闻,理性看待「4」字预期即可。

用户评论

  • 头像
    JJones_7
    边聊边改太上头了。

  • 头像
    TejaswiMugeraya
    纠结用哪个的话,我的经验是:要极致艺术审美和开源可控就选Midjourney或FLUX,要边聊边改、跨轮一致编辑、还能直接接API进生产流程就选GPT Image。我是做运营的,后者明显省事,少切好几个工具,出图到落地一条龙。

  • 头像
    Brenda_FosterZ
    说真的命名太乱,用户搜'DALL-E 4'想用最新,结果实际是GPT Image 1.5,预期落差很大。而且不少第三方测评吹的4K分辨率、30秒视频生成,目前都没有OpenAI官方佐证,当传闻看就好,别被带节奏。

  • 头像
    TendermintTina628
    我们团队把GPT Image接进内部设计工具批量生成商品图,文字渲染准确真的救了命——以前英文勉强能看、中文基本是鬼画符,现在连标语和UI文案都能直接出图。不过high质量偏慢,一张要十来秒,大批量跑的时候得自己控并发、写个队列,不然容易撞429。

  • 头像
    Diana.Baker168
    ChatGPT画图现在中文招牌都不乱码了,绝了。

  • 头像
    MelissaLewis_99284
    开发者视角说两句:gpt-image-1按token计费,低中高画质分别大约2、7、19美分一张方图,测试阶段用low就够了,全开high一天能烧好几十块。对我们做电商图的人来说,透明背景输出加上同端点生成加编辑这两点最实用,抠图换背景一个调用搞定。

  • 头像
    yellowlion918
    high档生成也太慢了,等得我泡面都凉了。

  • 头像
    狗狗436
    以前DALL·E 3写中文就是鬼画符,现在「深夜食堂」四个字笔画都对,做餐饮海报省事。

  • 头像
    Douglas_Cox_7
    中文长prompt偶尔还是会翻车,文字出错。官方建议把要渲染的字用引号括起来单独强调,有点玄学。

  • 头像
    Dylan.EvansJr5
    1.5跟谷歌Nano Banana比真实度和细节还是差一截,油腻感明显,但对话式编辑是真方便。

  • 头像
    JPhillips_20224
    我是做电商主图的,透明背景太实用,抠图换背景一个API搞定,以前得remove.bg加PS。

  • 头像
    PaulSullivanX
    并发限制太狠,开10个直接429,得自己写队列。

  • 头像
    汤莉燕
    多轮编辑是真的香,说把背景换成日落、给产品加logo,每次都接着上一版改,不用重来。

  • 头像
    SGomez_X
    免费档每天就几张,想爽用还得Plus。

  • 头像
    于欣
    OpenAI出了1.5提示词指南,结构按背景到主体到细节到限制写,出图稳很多,建议收藏。

  • 头像
    冬雪_11
    Altman那消防日历日期都错了,笑死。