DALL-E 4 工作室

OpenAI 以 GPT Image 體系打造的 ChatGPT 內建影象工作室,長板在文字渲染與對話式一致編輯

深度報告

  • 「DALL-E 4 工作室」並非 OpenAI 官方釋出的產品名稱。截至 2026 年 7 月,OpenAI 從未正式宣佈過「DALL-E 4」;其影象生成能力早已從 DALL·E 品牌轉向「GPT Image」體系(gpt-image-1 / gpt-image-1.5),並作為「隨身創意工作室」內嵌在 ChatGPT 中。本報告以確證事實為基座撰寫,並明確標註「DALL-E 4」屬資訊流命名口徑、尚無官方背書。

  • OpenAI 的文生圖始於 2021 年的 DALL·E 1,經 DALL·E 2(2022)、DALL·E 3(2023,深度整合 ChatGPT)演進。2025 年 3 月底,ChatGPT 上線全新影象生成功能,憑藉吉卜力風格和「AI 玩偶」迅速走紅,首周超 1.3 億使用者生成超 7 億張圖。同年 4 月,OpenAI 將該能力以 gpt-image-1 模型開放 API。進入 2026 年,官方進一步推出 gpt-image-1.5 與全新「影象」專區,把 ChatGPT 定位為「隨身創意工作室」。DALL·E 3 在 2026 年初被官方棄用,新功能與訓練全部轉向 GPT Image 體系。

  • 當前官方影象引擎的核心能力包括:原生文字渲染(可在圖內準確生成多詞標語、招牌、UI 文案,中文也已可用)、對話式多輪編輯(在同一會話裡「把背景換成日落」「給產品加個 logo」,逐次疊加不重來)、參考圖編輯(上傳圖片做區域性重繪、換背景、風格遷移,並保留人物相貌等關鍵資訊)、透明背景輸出,以及 C2PA 後設資料水印。新版模型生成速度提升多達 4 倍。這些能力共同構成了日常所說的「影象工作室」體驗。

  • 面向個人,ChatGPT 免費檔每日有有限生成次數,Plus 檔 20 美元/月可較充分地使用影象功能,Pro 檔更高。面向開發者,gpt-image-1 按 token 計費:文字輸入每百萬 token 5 美元、影象輸入 10 美元、影象輸出 40 美元,摺合低 / 中 / 高質量方形圖約每張 2 / 7 / 19 美分。已落地的企業包括 Adobe、Canva、Figma、Wix、Instacart、GoDaddy 等。

  • 正面來看,使用者普遍認可其文字渲染的飛躍——過去 DALL·E 3 畫中文幾乎鬼畫符,現在招牌文字清晰可讀;對話式迭代讓非專業使用者也能邊聊邊改。開發者則看重透明背景與同端點生成加編輯,電商摳圖換背景「一個 API 呼叫搞定」。負面聲音集中在:高畫質生成偏慢(high 檔約 10 至 15 秒);中文長 prompt 偶發文字錯誤;併發受限明顯,批次需自行做佇列;並且命名混亂——使用者搜「DALL-E 4」卻實際用的是 GPT Image 1,造成預期落差。

  • 行業共識是 OpenAI 已用 GPT Image 體系取代 DALL·E 品牌。在指令遵循與文字渲染上,gpt-image-1 被認為明顯優於 DALL·E 3,與 Midjourney、FLUX 等相比,強項在「對話上下文加一致編輯」,弱項在極致藝術審美與開源靈活度。多方評測指出,所謂「DALL-E 4」並不存在,真正驅動 2026 年 ChatGPT 影象的是 GPT Image 1 / 1.5。

  • 一是命名與預期管理:把未官宣的「DALL-E 4」當作已釋出產品傳播,容易誤導使用者。二是版權與合規:影象生成延續 DALL·E 3 的內容安全策略,限制生成公眾人物與侵權風格,併為每張圖打 C2PA 水印;但深度偽造、風格模仿仍存爭議。三是集中度風險:能力完全鎖在 ChatGPT 與 OpenAI API 內,企業依賴單一供應商。部分第三方測評聲稱的「4K 解析度、30 秒影片生成」等能力,目前無 OpenAI 官方佐證,應視為傳聞。

  • 適合需要快速出營銷圖、電商主圖、UI 素材、概念草圖,且希望「邊聊邊改」的創作者與團隊;開發者可經 API 接入生產流程。對追求極致藝術風格、開源可控或影片生成的使用者,Midjourney、FLUX、Sora 等仍是更對口的選擇。建議把「DALL-E 4 工作室」理解為 ChatGPT 內的 GPT Image 創意工作流,而非等待中的獨立產品。

  • 「DALL-E 4 工作室」實質是 OpenAI 以 GPT Image 體系打造的 ChatGPT 內建影象工作室;其長板在文字渲染與對話式一致編輯,硬傷在生成速度、命名混亂與第三方誇大的傳聞,理性看待「4」字預期即可。

使用者評論

  • 頭像
    JJones_7
    邊聊邊改太上頭了。

  • 頭像
    TejaswiMugeraya
    糾結用哪個的話,我的經驗是:要極致藝術審美和開源可控就選Midjourney或FLUX,要邊聊邊改、跨輪一致編輯、還能直接接API進生產流程就選GPT Image。我是做運營的,後者明顯省事,少切好幾個工具,出圖到落地一條龍。

  • 頭像
    Brenda_FosterZ
    說真的命名太亂,使用者搜'DALL-E 4'想用最新,結果實際是GPT Image 1.5,預期落差很大。而且不少第三方測評吹的4K解析度、30秒影片生成,目前都沒有OpenAI官方佐證,當傳聞看就好,別被帶節奏。

  • 頭像
    TendermintTina628
    我們團隊把GPT Image接進內部設計工具批次生成商品圖,文字渲染準確真的救了命——以前英文勉強能看、中文基本是鬼畫符,現在連標語和UI文案都能直接出圖。不過high質量偏慢,一張要十來秒,大批次跑的時候得自己控併發、寫個佇列,不然容易撞429。

  • 頭像
    Diana.Baker168
    ChatGPT畫圖現在中文招牌都不亂碼了,絕了。

  • 頭像
    MelissaLewis_99284
    開發者視角說兩句:gpt-image-1按token計費,低中高畫質分別大約2、7、19美分一張方圖,測試階段用low就夠了,全開high一天能燒好幾十塊。對我們做電商圖的人來說,透明背景輸出加上同端點生成加編輯這兩點最實用,摳圖換背景一個呼叫搞定。

  • 頭像
    yellowlion918
    high檔生成也太慢了,等得我泡麵都涼了。

  • 頭像
    狗狗436
    以前DALL·E 3寫中文就是鬼畫符,現在「深夜食堂」四個字筆畫都對,做餐飲海報省事。

  • 頭像
    Douglas_Cox_7
    中文長prompt偶爾還是會翻車,文字出錯。官方建議把要渲染的字用引號括起來單獨強調,有點玄學。

  • 頭像
    Dylan.EvansJr5
    1.5跟谷歌Nano Banana比真實度和細節還是差一截,油膩感明顯,但對話式編輯是真方便。

  • 頭像
    JPhillips_20224
    我是做電商主圖的,透明背景太實用,摳圖換背景一個API搞定,以前得remove.bg加PS。

  • 頭像
    PaulSullivanX
    併發限制太狠,開10個直接429,得自己寫佇列。

  • 頭像
    湯莉燕
    多輪編輯是真的香,說把背景換成日落、給產品加logo,每次都接著上一版改,不用重來。

  • 頭像
    SGomez_X
    免費檔每天就幾張,想爽用還得Plus。

  • 頭像
    於欣
    OpenAI出了1.5提示詞指南,結構按背景到主體到細節到限制寫,出圖穩很多,建議收藏。

  • 頭像
    冬雪_11
    Altman那消防日曆日期都錯了,笑死。