FLUX.2

Black Forest Labs が発表した次世代の画像生成および編集モデル ファミリは、最大 10 枚の参照画像と 4MP ネイティブ解像度出力の ID 一貫性のある融合をサポートします。

詳細レポート

  • 2025 年 11 月に Black Forest Labs によってリリースされた FLUX.2 は、現在利用可能な最も包括的な画像生成および編集モデルの 1 つです。フォトリアリズムの点で Midjourney V7 を上回り、最大 10 個の参照画像のアイデンティティ一貫性のある融合、4MP ネイティブ解像度出力、読みやすい複雑なタイポグラフィ レンダリング、および 32,000 トークンの超長いプロンプト ワード コンテキストをサポートします。同時に、Black Forest Labs はオープンソースの核となるコンセプトを継続し、Apache 2.0 プロトコルの 32B パラメーターのオープンウェイト バージョン FLUX.2 [dev] と軽量バージョン FLUX.2 [klein] をリリースし、Stability AI に次いでオープンソース コミュニティで最も活発な画像生成ベースとなりました。

  • Black Forest Labs は、潜在拡散モデル (Latent Diffusion) と安定拡散のオリジナル アーキテクチャの作成者である、元安定性 AI コア研究者の 4 人、Robin Rombach、Andreas Blattmann、Patrick Esser、Dominik Lorenz によって 2024 年に共同設立されました。同社はドイツのフライブルク (シュヴァルツヴァルト地域) と米国のサンフランシスコ ベイエリアに本社を置き、二重本社を運営しています。 設立から 1 年半も経たないうちに、BFL は驚くべきペースで資金調達を完了しました。2024 年 8 月には、General Catalyst および Y Combinator の Andreessen Horowitz が率いる 3,100 万米ドルのシードラウンドを受け取りました。その後、シリーズ A は a16z が主導し、NVIDIA、Creandum、Earlybird、Northzone が参加しました。 2025年12月に、32.5米ドル4億3,000万米ドルの評価額で3億米ドルのシリーズBを完了し、累計資金調達額は4億3,000万米ドルを超えました。これにより、BFL は世界で最も資金力のある純粋な画像生成モデリング会社となっています。 同社の中核ビジネス モデルは「オープン コア」です。フロントエンド モデルのオープン ウェイトによりコミュニティでの使用の敷居が大幅に下がり、バックエンドは収益化のための高性能 API を通じて企業顧客にサービスを提供します。 Adobe、Meta、Canva などの大手テクノロジー企業は、すでに API およびモデル ライセンスの顧客となっています。

  • FLUX.2 は単一のモデルではなく、複数のバリエーションを持つモデルのファミリーであり、リアルタイム推論から最高品質までの全範囲をカバーします。 **マルチリファレンス画像の融合** は FLUX.2 の最も顕著な機能です。ユーザーは同時に最大 10 枚の参照画像をアップロードでき、モデルは画像全体からキャラクター、製品、スタイル、構成の特徴を抽出し、一貫性が高くコンプライアンスに準拠していない出力に合成できます。これまではレタッチを繰り返したり、複数のツールを使用したりする必要がありましたが、例えば5人の異なるキャラクターの服装やポーズを1枚の商品ポスターに統合するといった作業が、FLUX.2では1世代で完了します。 **フォトリアリズム** も重要な利点です。複数のブラインド テストにおいて、FLUX.2 [pro] はフォトリアリズムの点で Midjourney V7 よりも優れており、特にポートレート、製品写真、屋内シーンなど、リアルなマテリアルと照明ロジックが必要なタスクで優れています。 FLUX.2 は、追加のアップスケーリングを必要とせずに、印刷品質を高めるために最大 4MP のネイティブ解像度出力をサポートします。 **テキスト レンダリング機能**は、FLUX.1 と比較して大幅に向上しています。複雑なタイポグラフィ、インフォグラフィック、UI プロトタイプの中国語と英語のテキストは、引き続き読みやすい状態です。フォントサイズが小さい場合は引き続き後処理が推奨されますが、ポスター、投資ペー​​ジ、インフォメーショングラフィックの制作などのニーズには導入段階に入っています。 **32K トークン プロンプト ワード コンテキスト** は、このモデルのアーキテクチャ レベルでの重要な設計上の決定です。ユーザーは、構造化された JSON 入力を使用して、前景、中景、背景の階層構成を詳細に示し、正確な色番号 (16 進コード)、照明角度、マテリアル特性を指定できます。これは、自動化されたパイプラインや大規模なバッチ生産シナリオで特に価値があります。 **正確なカラー コントロール** は、16 進数のブランド カラーの直接入力をサポートしており、モデルは非常に高い色精度で再現されます。 E コマース ブランドは、後段の色補正を必要とせずに、製品画像の主要な色とブランド ロゴの色を正確に制御できます。**4 つのレベルのモデル選択**: - FLUX.2 [最大]: 最高品質、リアルタイムのネットワーク検索ベースの地面生成をサポートし、最終資産出力に適しています - FLUX.2 [プロ]: コストパフォーマンスに最も優れたプロダクション グレード オプション、~$0.03/1024x1024 画像、生成に 6 ~ 9 秒 - FLUX.2 [flex]: パラメータ制御が必要な開発者向けに、サンプリング ステップ数とガイダンス比を調整できます (約 0.06 ドル/MP) - FLUX.2 [開発]: 32B オープンウェイト、独自の GPU に展開可能、非営利使用は無料、商用ライセンスは月額 999 ドル - FLUX.2 [klein]: Apache 2.0 プロトコルのオープンソース モデル、4B/9B サイズ、コンシューマ GPU (約 13GB VRAM) でリアルタイム実行可能

  • BFL は、ボリュームごとに支払う API 料金設定とオープン ウェイトを組み合わせたモデルを採用しています。 API 側の FLUX.2 [pro] の生成コストは画像 (1024x1024) あたり約 0.03 ドルで、Midjourney の月額サブスクリプションよりもはるかに安価です。 FLUX.2 [klein] API では画像あたりわずか $0.014 から。セルフホスト型ユーザーの場合、オープンウェイト バージョンをコストなしでローカルで実行できます (独自の GPU コンピューティング能力を持ち込むだけです)。 BFL の収益化の道筋は明確です。オープンウェイトを通じてコミュニティの心と開発者のエコロジーを掌握し、高性能 API を通じて企業からの支払いを獲得します。エンタープライズ ライセンスの顧客には Adob​​e、Meta、Canva が含まれており、このモデルが市場のハイエンドで認識されていることを証明しています。

  • 肯定的なレビューは、フォトリアリズムとマルチリファレンス フュージョン機能に焦点を当てていました。プロのレビュー ウェブサイト ThePlanetTools.ai は、総合スコア 9.2/10 を与え、ブラインド テストで FLUX.2 [プロ] が「フォトリアリズムの点で Midjourney V7 を上回った」と述べました。中国のメディアやコミュニティはまた、FLUX.2 の複数参照の一貫性と読みやすいテキストのレンダリングの進歩は「明らかに知覚可能」であり、FLUX.1 世代よりも「実装可能な」状態に近づいていると述べました。開発者コミュニティはオープンウェイト バージョンに熱心に反応し、FLUX.2 は ComfyUI エコシステムのデフォルト ベースとして Stable Diffusion を徐々に置き換えてきました。 否定的なフィードバックは主にいくつかの側面に集中しています。 FLUX.2 [pro] は API 固有のモデルであり、オープンウェイトがありません。セルフホスト型 [dev] バージョンでは、より高いコンピューティング能力が必要です (RTX 5090 または H100 レベルの GPU を推奨します)。 Midjourney の芸術的な様式化された作品と比較すると、FLUX.2 は写真のリアリズムに偏っており、絵画と様式化の点でわずかに劣っています。さらに、コミュニティの規模は依然として急速に成長しており、Stable Diffusion エコシステム内のプラグインと補助ツールの数には依然としてギャップがあります。

  • 業界では一般的に、FLUX.2 が 2026 年前半に最も影響力のあるイメージ モデル リリースになると考えられています。BFL のオープンソース戦略は、Stability AI ロードマップの継承とアップグレードとみなされます。これは、単に「モデルをリリースして実行する」だけではなく、完全な API、ドキュメント、エンタープライズ サポート、開発者ツール チェーンを備えています。 製品の位置づけに関して言えば、FLUX.2 の直接の競合相手には、Midjourney V7 (芸術的なスタイルでリード)、Ideogram 3 (小さいフォントの組版でリード)、Adobe Firefly (デザイン ツールとの緊密な統合)、および Google Imagen 3 (エコシステム バインディング) が含まれます。 FLUX.2 の主要な差別化点は、オープンソースに基づくオープン イノベーション + フォトリアリズム + マルチリファレンス フュージョン機能 + 構造化プロンプト ワード サポートです。これは、純粋なオープンソースのコミュニティ プロジェクトでも、純粋なクローズド ソースの商用 API でもなく、両方を組み合わせたものです。

  • オープンソースライセンスの側面は注目に値します。 FLUX.2 [dev] は非商用のオープンウェイト ライセンスを採用しており、エンタープライズによる商用利用には月額 999 ドルのライセンス料が必要です。この敷居は中小規模のスタートアップにとって決して低いものではなく、実際の「オープンソース」の程度は期待されているほど良くないという批判もコミュニティ内ではいくつかある。 もう 1 つの潜在的なリスクは、倫理とコンプライアンスの問題です。フォトリアリズムにより、AI によって生成されたコンテンツの識別がより困難になり、ディープフェイク、虚偽の広告、詐欺のシナリオに悪用される可能性があります。 BFL はコンテンツの安全性に関する声明を発表していますが、Midjourney や Adob​​e Firefly のような厳格なコンテンツ管理メカニズムがありません。 さらに、BFL は非常に競争の激しい市場環境に直面しています。 Midjourney は V8 バージョンの開発に取り組んでおり、Stability AI には新しいオープンソース モデルのロードマップがあり、Google と Meta は画像生成への投資を増やしています。 BFL は資金調達が潤沢な場合には先行者利益を得ることができますが、長期的な競争環境は依然として不透明です。

  • FLUX.2 は次のグループに最適です: e コマースおよびブランド マーケティング チーム (製品画像のバッチ生成、ブランド カラーの正確な制御)、広告クリエイティブ代理店 (複数参照の融合、役割の一貫性)、UI/UX デザイナー (インターフェイス プロトタイプおよびインフォグラフィック制作)、およびローカル展開を必要とする企業 ([dev] または [klein] バージョンを使用したセルフホスティング)。 次の人々には適していません: 純粋なアートの様式化された出力を追求するクリエイター (Midjourney が推奨)、コミュニティ プラグイン エコシステムに依存するワークフロー (引き続き Stable Diffusion が推奨)、コンピューティング能力が限られている個人ユーザー ([プロ] API コストは制御可能ですが、ローカル展開の敷居が高い)。 使用に関する推奨事項: ほとんどの制作シナリオでは、最もコスト効率の高い FLUX.2 [pro] を選択してください。正確な組版が必要なシナリオの場合は、[flex] にアップグレードします。ローカル展開には [dev] を選択します。リアルタイム インタラクションまたはエッジ デバイスには [klein] を選択してください。出力スタイルや品質特性が異なるため、同じワークフロー内で複数のバリアントを混合することはお勧めできません。

  • FLUX.2 は、2025 年から 2026 年の画像生成における最も重要なマイルストーンの 1 つです。これは、フォトリアリズムと製品レベルの使いやすさが共存できることを証明し、オープンソースのコア モデルが AI イメージングの分野で持続可能な商用閉ループを形成できることも証明します。 AI 実践者、デザイナー、開発者にとって、FLUX.2 は、API を使用する場合でも、独自の GPU で重みを実行する場合でも、真剣に受け止めるに値するモデル ファミリです。

ユーザーレビュー

  • 头像
    AnnaOrtiz
    FLUX.2 のマルチリファレンスの一貫性には本当に衝撃を受けました。 5 枚の参考写真をアップロードした後、キャラクターのアイデンティティは非常に安定した状態に保たれました。以前は一晩かかっていた作業が 1 回で生成されるようになりました。

  • 头像
    Madison_Reyes_Pro_146
    Pro バージョンをしばらく使用した後、フォトリアリズムが非常に強くなり、ポートレートがカメラで撮影したものとほぼ融合することができます。ただし、複雑なシーンではクラッシュすることがありますが、以前よりははるかに改善されました。

  • 头像
    Walter.BellIII
    価格は実際には高くなく、Pro 画像が 0.03 ドルで、Midjourney サブスクリプションよりもはるかに柔軟です。ただし、大量に生産される場合は、コストを計算する必要があります。

  • 头像
    Donald.LewisIII
    yyds では、Klein バージョンは 4090 上で実行され、数秒でイメージを生成できます。また、Apache 2.0 プロトコルの下でオープンソース化されており、企業でも使用できます。 BFL の景観は本当に広大です。

  • 头像
    Bitcoiner680_s
    Flex バージョンのテキスト レンダリングを試してみたところ、ポスター上の小さな中国語と英語の文字は基本的に読み取れることがわかりました。 Ideogram 3 よりはまだ劣っていますが、大きな進歩を遂げています。

  • 头像
    Joshua.PerryJr
    この 32K トークンのコンテキストは自動パイプラインに非常に適していると言いたいのです。 JSON 構造化されたプロンプトワードを投げ込むだけで、階層構造を理解できるようになります。革命的なバッチ生成。

  • 头像
    LWood062
    ComfyUI をアップグレードして FLUX.2 ノードをインストールし、NVIDIA の FP8 量子化と組み合わせて、もともと大型モデルを実行できなかった 3080 を実行できるようになりました。画質もまあまあです。

  • 头像
    ParkerRichter
    FLUX.2の緻密なカラーコントロールはとても良いです。 16 進数の色番号を直接入力することができ、ブランド カラーに誤差はありません。当社の e コマース チームは現在、製品画像をバッチで生成しています。以前は色補正を後の段階で行う必要がありましたが、今ではワンステップで行うことができます。

  • 头像
    海角10
    Dev バージョンの非商用ライセンスは少しわかりにくいです。タイトルに「オープンウェイト」と書かれているのを見て興奮したのですが、商用利用には月額999ドルかかることが分かりました。チームの予算が十分ではないため、個人的なプロジェクトしかできません。

  • 头像
    Daniel_Morgan_88
    小紅書風の写真には、特化した LoRA を備えた FLUX.2 Klein を使用していますが、その効果は多くのオンライン Web サイトよりも優れています。さらに、ローカルで実行する場合はキューに入る必要がなく、自由に生成できます。

  • 头像
    MrCléoMeunier_pro
    Midjourney V8と比較すると、画風という点ではMJがまだ上ですが、リアルさという点では確かにFLUX.2のほうが強いです。私の戦略は、両方を更新し、異なるシナリオで交互に使用することです。

  • 头像
    angryswan263
    純粋な C を使用して、Klein の推論エンジンを HN に実装している人を見ました。パフォーマンスは依然として Python スタックより 10 倍遅いですが、このアイデアは非常に興味深いものです。オープンソース コミュニティは FLUX に非常に熱心です。

  • 头像
    NoahCruz_66433
    同社が Midjourney から FLUX.2 Pro に切り替えた主な理由は API です。 MJ の API は今のところまだ中途半端ですが、BFL の API はクリーンで統合が簡単です。

  • 头像
    PhilipGutierrezZ0
    4MP出力を試してみましたが、確かにディテールは十分に豊かです。ただし、ローカルの Dev バージョンをスムーズに実行するには、H100 レベルが必要です。通常の 4090 は量子化バージョンを問題なく実行しますが、完全な精度で動作するのは困難です。

  • 头像
    greenduck678
    正直、商品撮影の分野では現状FLUX.2が最強です。十数セットの製品比較テストを実施し、光、影、素材のパフォーマンスが最も現実に近いものになりました。

  • 头像
    流光518
    FLUX.2 の構造化されたプロンプト ワードにより、試行錯誤のコストが大幅に削減されます。以前は自然言語で半日調整していましたが、今はJSONを直接書いて構成を制御しています。統一されたスタイルの一連の画像を作成したい場合は、プロンプト Word テンプレートのセットを使用するだけです。

  • 头像
    BobbyKing_2022
    Klein 9B バージョンが MacBook Pro M4 Max でスムーズに動作することを発見した人はいますか?クラウドに一切依存しないので、個人データの心配もありません。

  • 头像
    Brenda.Cook_88
    64GB VRAM 本気ですか?グラフの実行には 60 GB を超えるビデオ メモリが必要であり、これはデータ センターの移動を意味します。もちろん定量化すれば良くなりますが、それでも敷居が高すぎます。

  • 头像
    Andrew_Chavez_2022
    試してみた感想としては、PDF/図表生成に関してはFLUX.2が一番信頼できると感じました。以前は、情報グラフィックの生成に他のモデルが使用されており、テキストがどろどろしていました。ただし、FLUX.2 のフォントはより鮮明で、基本的にはそのまま使用できます。

  • 头像
    Lydia_Moore_88
    Flex バージョンは 1 ステップで $2.46 かかりますか?高価ですが、高精度のシーンには十分です。バッチで使用する場合は、Pro の方がコスト効率が高くなります。

  • 头像
    Diane_Perez_Pro
    BFLのチーム背景は確かに強力です。 Stable Diffusion のコアチームはこのチームから来ており、技術ロードマップは非常に安定しています。 4 億 3,000 万ドルの資金調達は無料ではなく、製品の反復速度は目に見えてわかります。

  • 头像
    Lauren.Stephens_202028
    FLUX.2 は国内市場によく適応しており、中国語のプロンプト単語をよくサポートしているため、英語で記述する必要はありません。また、コミュニティにはすでに多くの中国語チュートリアルがあるため、始めるのは難しくありません。

  • 头像
    pglnje2sse
    FLUX.2は前世代よりも光と影の理解がワンランク進んでいると感じます。 「夕日の下のガラス」と入力すると、実際に反射と屈折の効果を計算できます。 AI描画におけるこれまでの「平坦な光と影」の問題は基本的に解決されました。

  • 头像
    ACollins_202289
    初めて使い始めたときに罠に遭遇しました。ウェイトをダウンロードするには Hugging Face にログインする必要があるとは知らず、ネットワークの問題だと思いました。コミュニティのドキュメントは確かにまだ完璧ではありませんが、実行後の結果は驚くべきものです。

  • 头像
    Philip_OrtizJr
    マルチリファレンスは良いことですが、画像が 8 枚を超えるとゲインがわかりにくくなり、プロンプトの自由度が圧縮されます。実際に使用する場合は 5 ~ 6 枚までに抑えることをお勧めします。

  • 头像
    ChloeJackson_eth
    FLUX.2 エコシステムは急速に成長しています。 ComfyUI と Forge はネイティブ サポートを備えており、何千もの派生 LoRA モデルがあります。 SD ほど環境的に豊かではありませんが、勢いは増しています。

  • 头像
    万芳
    Adobe と Meta はどちらも BFL のモデルを使用しており、その信号は明確です。エンタープライズ レベルの画像生成の標準が FLUX によって再定義されています。

  • 头像
    魏琪
    比較テストを見た結果、FLUX.2 Pro と Nano Banana Pro にはそれぞれ勝者と敗者がいますが、価格は他のものに比べてほんの数分の一に過ぎません。 BFLの価格戦略は実に残酷だ。

  • 头像
    PeterNielsen
    独立した開発者として、Klein の Apache 2.0 ライセンスは私にとって非常に重要です。仲介業者による手数料やライセンスの罠について心配する必要はなく、商業利用のためにプロジェクトに直接組み込むだけです。

  • 头像
    NAbro
    FLUX.2のGrounded Generation機能(ウェブ検索)はちょっと面白くて、リアルタイムのイベントに関連した画像を生成できます。ただし、何度か試してみると、見つかった情報があまり関連性がなく、修正が必要な場合がありました。