DALL-E

OpenAI によって開発された第 3 世代 AI 画像生成モデルは ChatGPT と緊密に統合されており、会話型のテキストベースの画像生成をサポートしています。

詳細レポート

  • DALL・E 3 は、2023 年 9 月に OpenAI によってリリースされた第 3 世代のテキスト生成画像人工知能モデルです。前世代との最大の違いは、ChatGPT と深く統合されていることです。ユーザーは会話中に自然言語で希望の画像を説明するだけで、システムが自動的に最適化されたプロンプトワードを生成し、画像を生成します。このモデルはテキストのレンダリング精度の点で業界をリードしており、プロンプトの単語の意図を正確に復元できます。現在最も使いやすいAIペイントツールです。 2023 年 10 月に ChatGPT Plus ユーザーに公開され、DALL・E 2 は 2024 年 4 月に正式にオフラインになります。

  • OpenAI によってリリースされた DALL·E は、テキストの説明から画像を生成するように特別に設計された深層学習ベースの生成モデルです。その名前は、芸術家のサルバドール・ダリとウォルト・ディズニーの姓を組み合わせたものです。 DALL・E の第 1 世代は 2021 年 1 月にリリースされ、DALL・E 2 は 2022 年 4 月にリリースされ、DALL・E 3 は 2023 年 9 月にリリースされました。DALL・E 3 は、ユーザーが指定したテキストと完全に一致する画像を生成する機能において大きな進歩を遂げ、以前のシステムよりもはるかに多くのニュアンスや詳細を理解できるようになりました。

  • DALL・E 3 の中核機能は、自然言語テキストを高品質の画像に変換することです。ユーザーはこのツールをいくつかの方法で使用できます。ChatGPT Web バージョンに画像リクエストを直接入力し、会話を通じて繰り返し変更します。 Microsoft Bing Chat および Bing Chat Enterprise を介したアクセス。 DALL·E 3 API インターフェイスを使用して、プログラムによる呼び出しを行います。 ChatGPT との緊密な統合は、この製品の最大の技術的ハイライトです。 ChatGPT はブレインストーミング パートナーとして使用でき、簡単な説明を詳細な画像プロンプトに自動的に展開します。ユーザーは「猫です」と言うだけで、光と影、構図、スタイルなどの要素をシステムが自動的に追加します。このツールは、漫画、ドット絵、油絵など、さまざまなスタイルに対応しています。生成速度は約8~15秒、解像度は1024×1024です。 DALL·E 3 はセキュリティ メカニズムを完全に設計しています。生きているアーティストのスタイルで画像を使用するリクエストを拒否します。公人を描くリクエストを拒否する。 「レッドチーム」と協力してセキュリティパフォーマンスを向上させる。 AI が生成した画像を識別するための「ソース分類器」を開発します。 2024 年 2 月以降、DALL・E 3 によって生成されたすべての画像には C2PA 標準ウォーターマーク (目に見える CR シンボルと目に見えないメタデータを含む) が追加され、ユーザーは Content Credentials Verify Web サイトを通じて画像のソースを確認できるようになります。 Midjourney と Stable Diffusion を比較すると、DALL・E 3 はテキスト レンダリングの精度 (88% 対 45%) と使いやすさでリードしていますが、芸術的な品質とスタイル コントロールの点で Midjourney にわずかに遅れています。サードパーティによるテスト (100 以上のプロンプトワード、400 以上の画像、50 時間のテスト) では、DALL・E 3 で 8.8/10、Midjourney で 9.2/10、Stable Diffusion で 8.5/10 の総合スコアが得られました。

  • DALL・E 3 は 3 つの方法で利用できます。ChatGPT Plus の一部として (月額 20 ドル、1 日あたりのイメージ生成制限の上限と GPT-4o の使用権を含む)。無料版 (1 日あたり 3 枚の画像); API インターフェイス (標準品質 0.040 ドル/画像、HD 0.080 ドル/画像、従量課金制)。競合製品との比較: Midjourney は月額 10 ~ 120 ドルの複数のサブスクリプションを提供しており、Stable Diffusion は無料でローカルに展開できます。総合すると、DALL・E 3 の価格は、ChatGPT Plus に加入しているユーザーにとって、コストパフォーマンスに優れています。

  • Product Hunt プラットフォーム (フォロワー 172 人、レビュー 9 件、総合スコア 4.6/5) では、ユーザーは「テキストから高品質の画像を生成する」機能を最もよく認識しており (言及 5 件)、クリエイティブ プロジェクトにおけるその実用的価値も認めています (無料の画像ツールとして DALL·E を使用する Boolvideo など)。否定的なフィードバックは、画像内で長いテキストが不正確に表示されることに焦点を当てていました (2 件の言及)。つまり、短いテキストは適切にレンダリングされましたが、長いテキストにはスペル エラーが発生したり、順序が乱れたりしました。 中国ユーザーの実際の体験(Huxiuが再現したAppSOレビュー)では、テストで「白い服を着た李白と黒い服を着た杜甫のゲーム画像」を生成したところ、キャラクターが「国際的な友達」に変わったり、服の色が間違っていたり、チェスゲームも囲碁ではなくチェスとして認識されたりと、DALL・E 3が中国の文脈や特定の文化概念に対する理解がまだ不十分であることが示された。ただし、コミック ストリップ (4 コマ漫画) の生成エクスペリエンスはスムーズかつ高速であり、複数のスタイルのサポートが認められています。総合評価:DALL・E 3は最も「使いやすい」AIペイントツールです。プロンプトを学習しなくても開始できます。利便性を追求するユーザーに最適です。

  • 36Kr の報道によると、DALL E 3 はテキスト生成画像テクノロジーにおける重要な飛躍を示しており、OpenAI CEO の Sam Altman 氏も個人的にこの製品を支持したとのことです。 Midjourney などの競合製品と比較した DALL・E 3 の違いは、チャット インターフェイスとの緊密な統合により、使用の敷居が低くなっていることにあります。 TechCrunchのレポートは、トレーニングデータの侵害に関する以前の論争に応え、「アーティストがトレーニングをオプトアウトできるようにする」メカニズムに焦点を当てた。 The Verge は、C2PA ウォーターマークを追加する OpenAI の計画について報じましたが、メタデータは簡単に削除またはバイパスできるため、完璧なソリューションではないと指摘しました。

  • 2023 年 12 月、マイクロソフト ソフトウェア エンジニアリング部門マネージャーのシェーン ジョーンズは、DALL·E 3 モデルに NSFW の不適切なコンテンツを生成する可能性のある脆弱性があることを発見しました。それを報告した後、彼は「ブロッキング命令」を発行され、最終的に脆弱性を外部に公開することを選択し、製品のセキュリティレビュープロセスに対する懸念が生じました。さらに、OpenAI は、アーティストの著作権で保護された作品を生成 AI 画像モデルのトレーニングに使用した疑いで複数の著作権訴訟に直面しています。 DALL・E 2 は 2024 年 4 月に正式に発売され、OpenAI の画像生成製品ラインが大幅に調整されます。

  • DALL・E 3 は次のユーザーに適しています。複雑なプロンプトを学習したくない一般ユーザー。正確なテキストのレンダリングが必要なビジネス シナリオ (ポスターのイラストなど)。 ChatGPT Plus に加入しており、ワンストップの画像生成機能を必要とするユーザー。一連の画像を迅速に生成する必要があるコンテンツ作成者。究極の芸術的効果とプロフェッショナルなデザイン品質を追求するユーザーには適していません (Midjourney を選択することをお勧めします)。代替案には次のものがあります。 Midjourney (より芸術的な品質ですが、学習パラメータが必要です)。安定した拡散 (無料のオープンソース、技術者に適しています); Adobe Firefly (クリエイティブワークフロー統合)。

  • DALL・E 3 は、テキスト生成画像の分野における OpenAI の重要な反復を表しており、ChatGPT との緊密な統合により、AI 描画ツールの使いやすさの標準が再定義されます。究極の画質と芸術的なスタイルを追求するプロのクリエイターにとって、Midjourney は今でも最初の選択肢です。しかし、日常的なコンテンツ作成や商用アプリケーションのシナリオでは、DALL・E 3 は、そのゼロしきい値インタラクション手法と正確なテキスト レンダリング機能により、最も実用的な AI 画像生成ツールの 1 つになりました。

ユーザーレビュー

  • 头像
    Gregory_Hill_2023
    先週、私は e コマースの詳細ページを大量に作成し、20 枚の写真を API に送信しました。その結果、DALL-E 3 では一度に 10 枚までしか投稿できなかったため、5 回に分けて投稿することになりました。合計2分近く待ちました。さらに恥ずかしいのは、プロンプトの単語で固有名詞の綴りが 1 文字でも間違っているため、バッチ全体がひっくり返されて最初からやり直しになることです。エラー許容率は非常に低いです。 GPT-4o では、同じテンプレートのスペルを間違えた場合でも妥当な結果が得られ、一度に 40 秒で 20 枚の写真を取得できます。 DALL-E 3 は、エンジニアリング効率の点で、確かに独自の新しいモデルを上回りました。 API の明確な請求を除けば、これを使用する理由は他にありません。

  • 头像
    方丹桂
    ソーシャル グラフでのテキスト レンダリングに関しては、依然としてリストのトップにあります。英単語が 1 つまたは 2 つ含まれるタイトルは、基本的に 2 回修正する必要はありません。 Midjourney では 10 回中 3 回スペルミスがあります。しかし、中国語で書きたい場合は、期待しないでください。 「逢建食堂」のような看板は場合によっては正しく表示されることもありますが、少し長い詩はめちゃくちゃになることもあります。結局のところ、写真は単なる写真であり、文字はデザインソフトを使用して追加されます。

  • 头像
    阎涛
    セキュリティフィルターが非常に厳しいので、歴史的な戦争シーンですら拒否されてしまいます。

  • 头像
    EMweb
    最も快適なのは、会話の中で絵を変更できることです。 「背景を暗くして」「左側の人物を消して」と言うだけで再印刷されます。 MJ のようにプロンプ​​ト全体を覆して書き直す必要はありません。このインタラクションの閾値は非常に低いので、私の母親でも使用できます。

  • 头像
    Evelyn_DiazJr
    ChatGPT Plus をすでにお持ちの場合は、無料で利用できます。これは非常に便利です。

  • 头像
    LesterMarshall
    先ほど公式発表を見ました。 DALL-E 3 の API は 5 月 12 日に廃止され、GPT Image 1.5 に置き換えられます。統合を行っている場合は、急いで移行してください。サービスが停止される日まで待ってください。 ChatGPT は実際には昨年 3 月に静かに GPT-4o ネイティブ イメージに切り替えましたが、多くの人は気づきませんでした。

  • 头像
    段芳
    リアリズム面は本当に良いですね。独立したブラインドテストでは、GPT-4o の写真の信頼性は 87% ですが、DALL-E 3 の写真信頼性は 62% にすぎず、Midjourney と FLUX はさらに上回っています。特に人間の顔のクローズアップなど、安っぽいCGのようなプラスチック感は一見偽物に見えますし、実写のような質感を必要とする作品はやりません。手も描くのが難しく、5本の指は謎が多いです。

  • 头像
    Kelly.AlvarezJr6
    解像度は 1024x1792 に制限されており、倍率は組み込まれていません。ネットワーク画像を作るには十分ですが、印刷するとすぐにバレてしまいます。

  • 头像
    AClarkSr6
    政治家や有名人を描きたいですか?ブロックするだけです、方法はありません。

  • 头像
    hASHkING
    購読しない場合は、Bing Image Creator に無料でアクセスできます。 DALL-E 3 の基盤を使用しています。高速割り当てを 1 日 15 回使い切ると速度が低下しますが、引き続き使用できます。一時的な緊急事態には 1 つまたは 2 つあれば十分です。

  • 头像
    莲花_5
    最大の悩みは、スタイルの一貫性というものが存在しないことです。クライアント向けに 12 枚の製品写真のセットを作成します。これには、均一な光と影の構成とトーンが必要です。 DALL-E 3 を使用すると、各画像をランダムに再生したり、折りたたむように変更したりできます。シードや否定的なプロンプトの言葉がなければ、自然言語のみに頼ることができます。 Midjourneyのパラメータシステムを習得するには長い時間がかかります。シリーズやブランドのビジュアル作業に関しては、あまり当てにしないでください。

  • 头像
    GregoryGutierrez_2022
    ChatGPT はプロンプトの単語を拡張するのに役立ちますが、これは諸刃の剣です。場合によっては、自分の意思で望まない詳細を多数追加してしまい、元の意味が変わってしまうこともあります。

  • 头像
    Joshua.PetersonX
    指は依然として大きな問題であり、クローズアップは基本的に役に立ちません。

  • 头像
    Philip_Walker_66
    画像を生成する速度は実際には非常に速いです。 1 枚の画像は約 10 秒で作成できます。これは、GPT-4o のネイティブ描画速度の 1 ~ 2 分は言うまでもなく、Midjourney の 30 ~ 40 秒よりもはるかに高速です。スケッチを素早く繰り返す経験は問題ありません。

  • 头像
    William.Murray_99
    「砂漠の孤煙、長河に沈む夕日」に水墨画を加えてみました。 LLM は絵の芸術的概念をある程度理解できましたが、私が彼に絵に詩を書き込むように頼んだとき、彼は目が見えなくなりました。中国の絵文字はすべてゴーストシンボルでした。その後、教訓を学び、山、川、夕日の絵要素を表示させ、テキストを PS に戻して自分でアレンジしました。結局のところ、中国の書道や絵画の技法に対する理解はまだ浅いのです。斧で割った筆致の質感を復元できるGPT-4oとは比較にならない。純粋に構図の製図ツールとして使用できます。

  • 头像
    CAper
    価格はChatGPT Plusとバンドルされた20ドル、API標準画像が4セント、HD画像が8セント。高価ではありませんが、予測可能です。

  • 头像
    飞鸟744
    これらのパラメータ --stylize --chaos --ar がないと、MJ に慣れている人は非常に不快になるでしょう。

  • 头像
    Beverly.RussellK
    実際はとても活気があります。ピクサー スタイル、水彩画、フラット アイコン、小さなアイソメ図イラストを描画するよう依頼すると、出力はきれいで安定しています。様式化されたイラストが快適ゾーンです。それどころか、それは覆されたフォトリアルな製品です。その位置付けは非常に明確です。写真を説明するのはマーケティング担当者や記事執筆者のためであり、写真家のためではありません。

  • 头像
    JOhal
    現在、ChatGPT の画像クリックは、DALL-E 3 ではなく、ネイティブ GPT-4o セットに実際に調整されています。新しい利点は、クロスモーダルの理解にあります。複数のオブジェクトの空間ロジックとオクルージョン関係は 100% 正確であり、文化的シンボルも正確に認識できます。エンジニアの専門用語をたくさん分解することなく、「新海誠スタイル」を本当に理解できます。価格は遅く、写真を完成させるのにかかる時間はわずか 1 ~ 2 分です。 DALL-E 3 セットは非常に反応が良く、独自の使い方があります。

  • 头像
    LoriFoster
    API はスペルにあまりにも敏感です。固有名詞の 1 文字が間違っていると、バッチ生成全体が失敗する可能性があるため、注意してください。

  • 头像
    JacquelineLong
    短い英語のタイトルがとても良くて、一気にサインポスターが出来上がりました。

  • 头像
    JoshuaMurphy_66
    GPT Image 1.5 に移行するという通知を受け取りました。 DALL-E 3よりも短文レンダリングの精度が高いと言われているので、引退前にワークフローを再構築したところです。価格と現在の制限が変更されるかどうかはわかりませんが、様子を待っています。

  • 头像
    Kevin_King_7
    純粋な画質と芸術的センスという点では、Midjourney の映画的な雰囲気と FLUX のリアリズムは比類のないものです。 DALL-E 3 によって生成された写真は、技術的には正しいですが、少し「臨床的」で乾いた雰囲気があります。構図は正しいが、オーラに欠けている。得られるのは決して画質ではなく、閾値ゼロの会話エクスペリエンスと ChatGPT に関連付けられる利便性です。高品質な製品を作るには専門的な道具が必要ですが、カジュアルに使えるものを作るのが一番早いです。

  • 头像
    qmcbl9v37
    商業著作権について心配する必要はありません。生成された写真はあなたのものです。販売したり、公開したり、商品に組み込んだりできます。署名は必要ありません。 Fireflyと比較すると、IP補償保護はありませんが、日常のビジネス用途には十分です。

  • 头像
    傅怡琪
    ChatGPT Plus を契約したら、DALL-E 3 も付属していることがわかり、もったいない!

  • 头像
    JoshuaMiller007
    テキストのレンダリングは本当に強力です。 「ビーチでOPEN AIと書かれたTシャツを着たサングラスをかけた男性」を試してみると、実際にその文字を綴ることができます。

  • 头像
    枫叶_23
    描画速度は非常に速く、基本的に 10 秒以内に描画されます。これは、Midjourney の 1 分待ちのエクスペリエンスよりもはるかに優れています。

  • 头像
    bvsyny
    『ミッドジャーニー』と比べると、やはり面白くない。絵心はそこまで高くないですが、日常イラストなら十分です。

  • 头像
    trueIlanSimon_dev
    ChatGPT に「桃の花の木の下で漢服を着た女の子を描いて」と直接指示したところ、実際にかなり詳細な絵が生成されました。

  • 头像
    ElizabethJenkinsX455
    yyds!