深度報告
-
DALL·E 3 是 OpenAI 於 2023 年 9 月釋出的第三代文字生成影象人工智慧模型。與前代最大的區別在於它與 ChatGPT 深度整合,使用者只需在對話中用自然語言描述想要的圖片,系統即可自動生成最佳化的提示詞併產出影象。該模型在文字渲染準確度方面領先業界,能夠精準還原提示詞意圖,是目前最易用的 AI 繪畫工具。2023 年 10 月向 ChatGPT Plus 使用者開放,2024 年 4 月 DALL·E 2 正式下線。
-
DALL·E 由 OpenAI 釋出,是一種基於深度學習的生成模型,專門用於從文字描述生成影象。其名稱融合了藝術家 Salvador Dali 和 Walt Disney 的姓氏。2021 年 1 月 DALL·E 初代釋出,2022 年 4 月 DALL·E 2 上線,2023 年 9 月 DALL·E 3 釋出。DALL·E 3 在生成與使用者提供的文字完全一致的影象能力方面實現了重大飛躍,能夠理解的細微差別和細節明顯多於以前的系統。
-
DALL·E 3 的核心功能是將自然語言文字轉換為高質量影象。使用者可以透過幾種方式使用該工具:在 ChatGPT 網頁版中直接輸入影象請求並透過對話迭代修改;透過微軟 Bing Chat 和 Bing Chat Enterprise 訪問;使用 DALL·E 3 API 介面進行程式化呼叫。與 ChatGPT 的深度整合是該產品最大的技術亮點,ChatGPT 可以作為頭腦風暴夥伴,自動將簡單描述擴充套件為詳細的影象提示詞,使用者只需說「一隻貓」,系統會自動補充光影、構圖、風格等元素。該工具支援漫畫、畫素畫、油畫等多種風格,生成速度在 8-15 秒左右,解析度為 1024×1024。 DALL·E 3 在安全機制方面做了充分設計:拒絕要求使用在世藝術家風格圖片的請求;拒絕描繪公眾人物的請求;與「紅隊」合作提升安全效能;正在開發「來源分類器」用於識別 AI 生成影象。2024 年 2 月起,所有 DALL·E 3 生成的影象都會新增 C2PA 標準水印(包括可見 CR 符號和隱形後設資料),使用者可透過 Content Credentials Verify 網站驗證影象來源。 與 Midjourney 和 Stable Diffusion 對比,DALL·E 3 在文字渲染準確度(88% 對比 45%)和易用性方面領先,但在藝術質量和風格控制方面略遜於 Midjourney。第三方測試(100+ 提示詞、400+ 影象、50 小時測試)給出綜合評分:DALL·E 3 為 8.8/10,Midjourney 為 9.2/10,Stable Diffusion 為 8.5/10。
-
DALL·E 3 透過三種方式提供:作為 ChatGPT Plus 的一部分($20 / 月,含更高每日影象生成限額和 GPT-4o 使用權);免費版(每日 3 張);API 介面(標準質量 $0.040 / 張,高畫質 $0.080 / 張,按用量付費)。與競品相比:Midjourney 提供 $10-120 / 月多檔訂閱,Stable Diffusion 可免費本地部署。綜合來看,DALL·E 3 的定價對於已訂閱 ChatGPT Plus 的使用者而言價效比突出。
-
Product Hunt 平臺(172 關注者,9 條評價,綜合評分 4.6/5)中,使用者對「根據文字生成高質量影象」功能最為認可(5 次提及),也肯定了其在創意專案中的實用價值(如 Boolvideo 將 DALL·E 用於免費影象工具)。負面反饋主要集中在較長的文字在影象中顯示不準確(2 次提及),即短文字渲染優秀但長文字會出現拼寫錯誤或順序混亂。 中文使用者實際體驗(虎嗅轉載 AppSO 評測)中,測試生成「李白穿白衣、杜甫穿黑衣的對弈圖」時,人物變成了「國際友人」,衣服顏色出錯,棋類也被識別為國際象棋而非圍棋,說明 DALL·E 3 對中文語境和特定文化概念的理解仍有不足。但生成連環畫(四格漫畫)的體驗流暢,速度較快,多種風格支援得到認可。綜合評價:DALL·E 3 是最「好用」的 AI 繪畫工具,無需學習 prompt 即可上手,適合追求便捷的使用者。
-
36氪報道指出,DALL·E 3 標誌著文字生成影象技術的重要飛躍,OpenAI CEO Sam Altman 也親自為產品站臺。與 Midjourney 等競品相比,DALL·E 3 的差異化在於與聊天介面深度整合,降低了使用門檻。TechCrunch 報道則關注其「允許藝術家選擇退出訓練」機制,回應了此前關於訓練資料侵權的爭議。The Verge 報道了 OpenAI 新增 C2PA 水印的計劃,但同時指出後設資料可被輕易刪除或繞過,該方案並非完美解決方案。
-
2023 年 12 月,微軟軟體工程部門經理 Shane Jones 發現 DALL·E 3 模型存在可生成 NSFW 不當內容的漏洞,上報後被下達「封口令」,最終選擇向外界披露該漏洞,引發對產品安全稽核流程的關注。此外,OpenAI 因涉嫌使用藝術家受版權保護的作品訓練生成式 AI 影象模型而面臨多起版權訴訟。DALL·E 2 於 2024 年 4 月正式下線,標誌著 OpenAI 影象生成產品線的重大調整。
-
DALL·E 3 適合以下使用者:不想學習複雜 prompt 的普通使用者;需要準確文字渲染的商業場景(如海報配圖);已訂閱 ChatGPT Plus 希望一站式獲得影象生成能力的使用者;需要快速生成系列影象的內容創作者。不適合追求極致藝術效果和專業設計品質的使用者(建議選擇 Midjourney)。替代方案包括:Midjourney(藝術質量更高,但需學習引數);Stable Diffusion(免費開源,適合技術人員);Adobe Firefly(創意工作流整合)。
-
DALL·E 3 代表了 OpenAI 在文字生成影象領域的重要迭代,其與 ChatGPT 的深度整合重新定義了 AI 繪畫工具的易用性標準。對於追求極致畫質和藝術風格的專業創作者,Midjourney 仍是首選;但對於日常內容創作和商業應用場景,DALL·E 3 以其零門檻的互動方式和準確的文字渲染能力,成為最具實用價值的 AI 影象生成工具之一。
使用者評論
-
Gregory_Hill_2023—上週趕一批電商詳情頁,二十張圖給到 API,結果 DALL-E 3 單次只能十張,被迫分五批提交,總共等了快兩分鐘。更坑的是提示詞裡把一個專有名詞拼錯了一個字母,整批直接翻車重來,容錯率是真的低。GPT-4o 那邊同樣的模板拼錯都能給你腦補出合理結果,一次四十來秒二十張。DALL-E 3 在工程效率這塊確實已經被自家新模型比下去了,除了 API 計費清楚這點還留著,別的真沒什麼非它不可的理由了。 -
方丹桂—做社交圖它的文字渲染還是第一梯隊,一兩個英文單詞的標題基本不用二次修,Midjourney 那邊十次有三次拼錯。但你要寫中文就別指望了,「風間食堂」這種招牌偶爾能蒙對,稍微長一點的詩句直接亂成一鍋,最後還是老老實實畫面歸畫面、文字用設計軟體另加。 -
閻濤—安全過濾器嚴到離譜,畫個歷史戰爭場景都能給我拒了。 -
EMweb—最舒服的還是能在對話裡改圖,說一句「背景暗一點」「把左邊那個人去掉」它就重出一版,不用像 MJ 那樣整條提示詞推倒重寫。這個互動門檻低到我媽都能用。 -
Evelyn_DiazJr—已經有 ChatGPT Plus 的話它就等於白送,挺香的。 -
LesterMarshall—剛看到官方公告,DALL-E 3 的 API 五月十二號就退役了,接班的是 GPT Image 1.5。手裡有整合的趕緊排遷移吧,別等到停服那天抓瞎。ChatGPT 裡其實去年三月就悄悄換成 GPT-4o 原生生圖了,很多人壓根沒察覺。 -
段芳—寫實這塊是真拉了。獨立盲測裡 GPT-4o 有 87% 的照片可信度,DALL-E 3 才 62%,Midjourney 和 FLUX 更是甩開一截。特別是人臉特寫,那種廉價 CG 的塑膠感一眼假,凡是要真人質感的活兒我都不碰它了。手也畫不利索,五根手指經常玄學。 -
Kelly.AlvarezJr6—解析度封頂 1024x1792,還沒有內建放大,做網圖夠用,一放到印刷就露餡。 -
AClarkSr6—想畫個政要或者名人?直接遮蔽,門都沒有。 -
hASHkING—沒訂閱的可以去 Bing Image Creator 白嫖,用的就是 DALL-E 3 的底子,每天十五次快速額度用完之後變慢但還能接著出,臨時應急一兩張夠了。 -
蓮花_5—最頭疼的是沒有風格一致性這回事。給客戶做一套十二張的產品圖,要求光影構圖色調統一,DALL-E 3 每張都給你隨機發揮,改到崩潰。沒有 seed 沒有負向提示詞,你只能靠自然語言硬掰,掰半天不如去學 Midjourney 的引數體系。做系列、做品牌視覺這種活兒真心別指望它。 -
GregoryGutierrez_2022—ChatGPT 幫你擴寫提示詞是雙刃劍,有時候自作主張加一堆你沒要的細節,把原意都改跑偏了。 -
Joshua.PetersonX—手指還是老大難,特寫基本報廢。 -
Philip_Walker_66—出圖速度倒是快,十來秒一張,比 Midjourney 那三四十秒利索多了,更別說 GPT-4o 原生生圖那個一兩分鐘的龜速。要快速迭代出草圖這點體驗還行。 -
William.Murray_99—試過給「大漠孤煙直,長河落日圓」配水墨圖,畫面意境 LLM 能理解個七七八八,但一讓它把詩句寫進畫裡就抓瞎,中文字形全是鬼畫符。後來學乖了,只讓它出山河落日的畫面元素,文字回 PS 裡自己排。說到底它對中文書畫的技法理解還是淺,跟 GPT-4o 那種能還原斧劈皴筆意的沒法比,純當個構圖草稿工具用還湊合。 -
CAper—價格就是捆在 ChatGPT Plus 裡那二十刀,API 標準圖四美分、HD 八美分一張,算下來不算貴,勝在可預估。 -
飛鳥744—沒有 --stylize --chaos --ar 這些引數,玩慣 MJ 的會很不適應。 -
Beverly.RussellK—它其實挺挑活的,你讓它畫皮克斯風、水彩、扁平圖示、等距小插畫,出來的東西乾淨又穩,風格化插圖是它的舒適區。反倒是照片級寫實老翻車,定位很清楚,就是給營銷和寫文章的人配圖用的,不是給攝影師的。 -
JOhal—現在 ChatGPT 裡點生圖其實調的是 GPT-4o 原生那套,不是 DALL-E 3 了。新的勝在跨模態理解,多物件的空間邏輯、遮擋關係能百分百擺對,文化符號也認得準,說「新海誠風格」它真懂,不用你拆成一堆工程師黑話。代價就是慢,一張動輒一兩分鐘。想快還是老 DALL-E 3 那套響應爽,各有各的用法。 -
LoriFoster—API 對拼寫太敏感了,專有名詞錯一個字母能讓整批生成失敗,得盯緊。 -
JacquelineLong—短英文標題它是真能打,招牌海報一次成型。 -
JoshuaMurphy_66—接到通知說要遷到 GPT Image 1.5,據說短文字渲染比 DALL-E 3 還準,正好趁退役前把工作流重構一遍。就是不知道價格和限流會不會變,觀望中。 -
Kevin_King_7—論純畫質和藝術感,Midjourney 那種電影味兒和 FLUX 的寫實它都比不了,DALL-E 3 出的圖技術上沒錯但有點「clinical」的乾巴感,構圖對但缺靈氣。它贏的從來不是畫質,是那個零門檻的對話式體驗和跟 ChatGPT 綁在一起的便利。要出精品還得上專業工具,要順手隨便出個能用的它最快。 -
qmcbl9v37—商用版權這點省心,生成的圖歸你,賣錢、出版、放產品裡都行,不用署名。比起 Firefly 少了個 IP 賠償保障,但日常商用夠用了。 -
傅怡琪—訂閱了 ChatGPT Plus 之後才發現還送 DALL-E 3,簡直是白嫖! -
JoshuaMiller007—文字渲染確實強,試試「一個戴墨鏡的人在沙灘上寫著OPEN AI的T恤」,它真的能把那幾個字母拼出來。 -
楓葉_23—畫圖速度是真的快,基本 10 秒以內就出來了,比 Midjourney 那種等一分鐘的體驗好太多。 -
bvsyny—跟 Midjourney 比還是差點意思,藝術感不夠強,但日常配圖夠用了。 -
trueIlanSimon_dev—直接跟 ChatGPT 說「畫一個穿漢服的女生在桃花樹下」,它居然真的生成了,細節還挺豐富。 -
ElizabethJenkinsX455—yyds!