深度报告
-
DALL·E 3 是 OpenAI 于 2023 年 9 月发布的第三代文本生成图像人工智能模型。与前代最大的区别在于它与 ChatGPT 深度集成,用户只需在对话中用自然语言描述想要的图片,系统即可自动生成优化的提示词并产出图像。该模型在文字渲染准确度方面领先业界,能够精准还原提示词意图,是目前最易用的 AI 绘画工具。2023 年 10 月向 ChatGPT Plus 用户开放,2024 年 4 月 DALL·E 2 正式下线。
-
DALL·E 由 OpenAI 发布,是一种基于深度学习的生成模型,专门用于从文本描述生成图像。其名称融合了艺术家 Salvador Dali 和 Walt Disney 的姓氏。2021 年 1 月 DALL·E 初代发布,2022 年 4 月 DALL·E 2 上线,2023 年 9 月 DALL·E 3 发布。DALL·E 3 在生成与用户提供的文本完全一致的图像能力方面实现了重大飞跃,能够理解的细微差别和细节明显多于以前的系统。
-
DALL·E 3 的核心功能是将自然语言文本转换为高质量图像。用户可以通过几种方式使用该工具:在 ChatGPT 网页版中直接输入图像请求并通过对话迭代修改;通过微软 Bing Chat 和 Bing Chat Enterprise 访问;使用 DALL·E 3 API 接口进行程序化调用。与 ChatGPT 的深度集成是该产品最大的技术亮点,ChatGPT 可以作为头脑风暴伙伴,自动将简单描述扩展为详细的图像提示词,用户只需说「一只猫」,系统会自动补充光影、构图、风格等元素。该工具支持漫画、像素画、油画等多种风格,生成速度在 8-15 秒左右,分辨率为 1024×1024。 DALL·E 3 在安全机制方面做了充分设计:拒绝要求使用在世艺术家风格图片的请求;拒绝描绘公众人物的请求;与「红队」合作提升安全性能;正在开发「来源分类器」用于识别 AI 生成图像。2024 年 2 月起,所有 DALL·E 3 生成的图像都会添加 C2PA 标准水印(包括可见 CR 符号和隐形元数据),用户可通过 Content Credentials Verify 网站验证图像来源。 与 Midjourney 和 Stable Diffusion 对比,DALL·E 3 在文字渲染准确度(88% 对比 45%)和易用性方面领先,但在艺术质量和风格控制方面略逊于 Midjourney。第三方测试(100+ 提示词、400+ 图像、50 小时测试)给出综合评分:DALL·E 3 为 8.8/10,Midjourney 为 9.2/10,Stable Diffusion 为 8.5/10。
-
DALL·E 3 通过三种方式提供:作为 ChatGPT Plus 的一部分($20 / 月,含更高每日图像生成限额和 GPT-4o 使用权);免费版(每日 3 张);API 接口(标准质量 $0.040 / 张,高清 $0.080 / 张,按用量付费)。与竞品相比:Midjourney 提供 $10-120 / 月多档订阅,Stable Diffusion 可免费本地部署。综合来看,DALL·E 3 的定价对于已订阅 ChatGPT Plus 的用户而言性价比突出。
-
Product Hunt 平台(172 关注者,9 条评价,综合评分 4.6/5)中,用户对「根据文本生成高质量图像」功能最为认可(5 次提及),也肯定了其在创意项目中的实用价值(如 Boolvideo 将 DALL·E 用于免费图像工具)。负面反馈主要集中在较长的文字在图像中显示不准确(2 次提及),即短文本渲染优秀但长文本会出现拼写错误或顺序混乱。 中文用户实际体验(虎嗅转载 AppSO 评测)中,测试生成「李白穿白衣、杜甫穿黑衣的对弈图」时,人物变成了「国际友人」,衣服颜色出错,棋类也被识别为国际象棋而非围棋,说明 DALL·E 3 对中文语境和特定文化概念的理解仍有不足。但生成连环画(四格漫画)的体验流畅,速度较快,多种风格支持得到认可。综合评价:DALL·E 3 是最「好用」的 AI 绘画工具,无需学习 prompt 即可上手,适合追求便捷的用户。
-
36氪报道指出,DALL·E 3 标志着文本生成图像技术的重要飞跃,OpenAI CEO Sam Altman 也亲自为产品站台。与 Midjourney 等竞品相比,DALL·E 3 的差异化在于与聊天界面深度整合,降低了使用门槛。TechCrunch 报道则关注其「允许艺术家选择退出训练」机制,回应了此前关于训练数据侵权的争议。The Verge 报道了 OpenAI 添加 C2PA 水印的计划,但同时指出元数据可被轻易删除或绕过,该方案并非完美解决方案。
-
2023 年 12 月,微软软件工程部门经理 Shane Jones 发现 DALL·E 3 模型存在可生成 NSFW 不当内容的漏洞,上报后被下达「封口令」,最终选择向外界披露该漏洞,引发对产品安全审核流程的关注。此外,OpenAI 因涉嫌使用艺术家受版权保护的作品训练生成式 AI 图像模型而面临多起版权诉讼。DALL·E 2 于 2024 年 4 月正式下线,标志着 OpenAI 图像生成产品线的重大调整。
-
DALL·E 3 适合以下用户:不想学习复杂 prompt 的普通用户;需要准确文字渲染的商业场景(如海报配图);已订阅 ChatGPT Plus 希望一站式获得图像生成能力的用户;需要快速生成系列图像的内容创作者。不适合追求极致艺术效果和专业设计品质的用户(建议选择 Midjourney)。替代方案包括:Midjourney(艺术质量更高,但需学习参数);Stable Diffusion(免费开源,适合技术人员);Adobe Firefly(创意工作流集成)。
-
DALL·E 3 代表了 OpenAI 在文本生成图像领域的重要迭代,其与 ChatGPT 的深度集成重新定义了 AI 绘画工具的易用性标准。对于追求极致画质和艺术风格的专业创作者,Midjourney 仍是首选;但对于日常内容创作和商业应用场景,DALL·E 3 以其零门槛的交互方式和准确的文字渲染能力,成为最具实用价值的 AI 图像生成工具之一。
用户评论
-
Gregory_Hill_2023—上周赶一批电商详情页,二十张图给到 API,结果 DALL-E 3 单次只能十张,被迫分五批提交,总共等了快两分钟。更坑的是提示词里把一个专有名词拼错了一个字母,整批直接翻车重来,容错率是真的低。GPT-4o 那边同样的模板拼错都能给你脑补出合理结果,一次四十来秒二十张。DALL-E 3 在工程效率这块确实已经被自家新模型比下去了,除了 API 计费清楚这点还留着,别的真没什么非它不可的理由了。 -
方丹桂—做社交图它的文字渲染还是第一梯队,一两个英文单词的标题基本不用二次修,Midjourney 那边十次有三次拼错。但你要写中文就别指望了,「风间食堂」这种招牌偶尔能蒙对,稍微长一点的诗句直接乱成一锅,最后还是老老实实画面归画面、文字用设计软件另加。 -
阎涛—安全过滤器严到离谱,画个历史战争场景都能给我拒了。 -
EMweb—最舒服的还是能在对话里改图,说一句「背景暗一点」「把左边那个人去掉」它就重出一版,不用像 MJ 那样整条提示词推倒重写。这个交互门槛低到我妈都能用。 -
Evelyn_DiazJr—已经有 ChatGPT Plus 的话它就等于白送,挺香的。 -
LesterMarshall—刚看到官方公告,DALL-E 3 的 API 五月十二号就退役了,接班的是 GPT Image 1.5。手里有集成的赶紧排迁移吧,别等到停服那天抓瞎。ChatGPT 里其实去年三月就悄悄换成 GPT-4o 原生生图了,很多人压根没察觉。 -
段芳—写实这块是真拉了。独立盲测里 GPT-4o 有 87% 的照片可信度,DALL-E 3 才 62%,Midjourney 和 FLUX 更是甩开一截。特别是人脸特写,那种廉价 CG 的塑料感一眼假,凡是要真人质感的活儿我都不碰它了。手也画不利索,五根手指经常玄学。 -
Kelly.AlvarezJr6—分辨率封顶 1024x1792,还没有内置放大,做网图够用,一放到印刷就露馅。 -
AClarkSr6—想画个政要或者名人?直接屏蔽,门都没有。 -
hASHkING—没订阅的可以去 Bing Image Creator 白嫖,用的就是 DALL-E 3 的底子,每天十五次快速额度用完之后变慢但还能接着出,临时应急一两张够了。 -
莲花_5—最头疼的是没有风格一致性这回事。给客户做一套十二张的产品图,要求光影构图色调统一,DALL-E 3 每张都给你随机发挥,改到崩溃。没有 seed 没有负向提示词,你只能靠自然语言硬掰,掰半天不如去学 Midjourney 的参数体系。做系列、做品牌视觉这种活儿真心别指望它。 -
GregoryGutierrez_2022—ChatGPT 帮你扩写提示词是双刃剑,有时候自作主张加一堆你没要的细节,把原意都改跑偏了。 -
Joshua.PetersonX—手指还是老大难,特写基本报废。 -
Philip_Walker_66—出图速度倒是快,十来秒一张,比 Midjourney 那三四十秒利索多了,更别说 GPT-4o 原生生图那个一两分钟的龟速。要快速迭代出草图这点体验还行。 -
William.Murray_99—试过给「大漠孤烟直,长河落日圆」配水墨图,画面意境 LLM 能理解个七七八八,但一让它把诗句写进画里就抓瞎,中文字形全是鬼画符。后来学乖了,只让它出山河落日的画面元素,文字回 PS 里自己排。说到底它对中文书画的技法理解还是浅,跟 GPT-4o 那种能还原斧劈皴笔意的没法比,纯当个构图草稿工具用还凑合。 -
CAper—价格就是捆在 ChatGPT Plus 里那二十刀,API 标准图四美分、HD 八美分一张,算下来不算贵,胜在可预估。 -
飞鸟744—没有 --stylize --chaos --ar 这些参数,玩惯 MJ 的会很不适应。 -
Beverly.RussellK—它其实挺挑活的,你让它画皮克斯风、水彩、扁平图标、等距小插画,出来的东西干净又稳,风格化插图是它的舒适区。反倒是照片级写实老翻车,定位很清楚,就是给营销和写文章的人配图用的,不是给摄影师的。 -
JOhal—现在 ChatGPT 里点生图其实调的是 GPT-4o 原生那套,不是 DALL-E 3 了。新的胜在跨模态理解,多对象的空间逻辑、遮挡关系能百分百摆对,文化符号也认得准,说「新海诚风格」它真懂,不用你拆成一堆工程师黑话。代价就是慢,一张动辄一两分钟。想快还是老 DALL-E 3 那套响应爽,各有各的用法。 -
LoriFoster—API 对拼写太敏感了,专有名词错一个字母能让整批生成失败,得盯紧。 -
JacquelineLong—短英文标题它是真能打,招牌海报一次成型。 -
JoshuaMurphy_66—接到通知说要迁到 GPT Image 1.5,据说短文字渲染比 DALL-E 3 还准,正好趁退役前把工作流重构一遍。就是不知道价格和限流会不会变,观望中。 -
Kevin_King_7—论纯画质和艺术感,Midjourney 那种电影味儿和 FLUX 的写实它都比不了,DALL-E 3 出的图技术上没错但有点「clinical」的干巴感,构图对但缺灵气。它赢的从来不是画质,是那个零门槛的对话式体验和跟 ChatGPT 绑在一起的便利。要出精品还得上专业工具,要顺手随便出个能用的它最快。 -
qmcbl9v37—商用版权这点省心,生成的图归你,卖钱、出版、放产品里都行,不用署名。比起 Firefly 少了个 IP 赔偿保障,但日常商用够用了。 -
傅怡琪—订阅了 ChatGPT Plus 之后才发现还送 DALL-E 3,简直是白嫖! -
JoshuaMiller007—文字渲染确实强,试试「一个戴墨镜的人在沙滩上写着OPEN AI的T恤」,它真的能把那几个字母拼出来。 -
枫叶_23—画图速度是真的快,基本 10 秒以内就出来了,比 Midjourney 那种等一分钟的体验好太多。 -
bvsyny—跟 Midjourney 比还是差点意思,艺术感不够强,但日常配图够用了。 -
trueIlanSimon_dev—直接跟 ChatGPT 说「画一个穿汉服的女生在桃花树下」,它居然真的生成了,细节还挺丰富。 -
ElizabethJenkinsX455—yyds!