LoongForge

百度(Baidu)百舸がオープンソース化した全モダリティ学習フレームワーク。LLM・VLM・拡散モデル・身体性AIの学習を1つの統一フレームワークでカバーし、NVIDIA GPUと崑崙芯XPUをネイティブサポート

詳細レポート

  • LoongForge は、Baidu Baige が最近正式にオープンソース化したフルモーダル トレーニング フレームワークで、内部トレーニング アクセラレーション スタック AIAK-Training-LLM から進化しました。統合フレームワークを使用して、大規模言語モデル (LLM)、視覚言語モデル (VLM)、拡散モデル (Diffusion)、および身体化されたインテリジェンス (Embodied) の 4 つのモードのトレーニング ニーズをカバーします。メインストリーム モデルで 15% ~ 50% のエンドツーエンド トレーニングの高速化を実現し、NVIDIA GPU および Kunlun XPU デュアル ハードウェア プラットフォームをネイティブにサポートします。このフレームワークは、教育、コンピュータ ビジョン、および身体化インテリジェンスの分野で企業顧客による大規模な実稼働検証を経験しており、最大クラスタ サイズは 5,000 アクセラレータを超え、Apache-2.0 プロトコルを使用するオープンソースです。

  • LoongForge の前身は、Baidu Baige が社内で使用している長期トレーニング加速フレームワークである AIAK-Training-LLM です。正式にオープンソース化される前に、すでに複数の業界の企業顧客の間で実稼働レベルのテストに耐えており、教育シナリオでのモデル トレーニング、コンピューター ビジョンでのマルチモーダル タスク、および身体化されたインテリジェンス VLA (Visual-Language-Action) モデルがすべて実装されています。 2026 年 4 月、Baidu Baige は正式にオープンソース化することを決定し、同シリーズの LoongFlow (エキスパート AI エージェントのための思考および学習フレームワーク) を反映して、Baige Loong オープンソース シリーズに加わり、LoongForge と名付けました。 「LoongForge」という名前は、中国の伝統的なドラゴンボートから取られており、力を合わせて波を打ち破ることを意味します。 2026 年 7 月の時点で、GitHub リポジトリには 150 を超えるスターがあり、高レベルのコミュニティ活動が維持されています。チームのエンジニアリング ブログは、異種並列トレーニング、DP ロード バランシング、VLA モデル アクセラレーションなどのトピックをカバーする、技術的に詳細な記事を定期的に更新しています。コンテンツの質は高く、プロジェクト チームがテクノロジーへの投資を継続していることがわかります。

  • LoongForge の中核的な位置付けは明確です。1 つのフレームワーク、4 つのモードです。そのアーキテクチャは 3 つの層に分かれています。モデル層は統一された抽象化を担当し、システム層はエンドツーエンドの最適化に重点を置き、ハードウェア層はクロスプラットフォームの適応を解決します。 モデル層では、LoongForge は Megatron-LM の上にモデル抽象化層を構築し、マルチモーダル モデルを知覚エンコード層 (Encoder)、生成バックボーン層 (Foundation)、結合スケジューリング層の 3 つの部分に分解しました。新しいモデルにアクセスするには、対応するコンポーネントを登録し、基礎となるコードを書き直すことなく、YAML 構成ファイルを介してモジュールのスプライシングと並列戦略の構成を完了するだけです。実際のテストでは、チームが LLaVA-OneVision の新しいビジュアル エンコーダ RICE-ViT を適応させるのにわずか数日しかかかりませんでした。従来のソリューションの数週間にわたる適応サイクルと比較すると、大きなギャップがありました。 Qwen3.5 の言語バックボーンを DeepSeek V3 に置き換える場合は、YAML 参照パスを 1 行で変更するだけです。ウェアハウス全体をフォークする必要はありません。 システム レベルでの最適化はより集中的です。 LLM ベースの場合、LoongForge は CCT 計算と送信の並列処理を実装し、長いシーケンスのトレーニングにおける MoE モデルの計算、通信、データ送信を均一に調整します。測定された Qwen3-30B-A3B トレーニング パフォーマンスは、32K シーケンス長の下で 16% 増加しました。 ChunkPipe パイプラインの並列処理により、超長いシーケンスのメモリ ボトルネックが解決され、数百万のコンテキスト ウィンドウを中小規模のクラスターで実行できるようになります。 DeepSeek V3.2 の DSA スパース アテンション アーキテクチャに関して、LoongForge はアテンション計算リンク全体でディープ オペレータ フュージョンと最適化を実行し、エンドツーエンドのパフォーマンスを約 5 倍向上させました。 マルチモーダル最適化の面では、DP 負荷分散メカニズムが特に重要です。従来のデータ並列処理で長さが非常に不均一なマルチモーダル データ (1 枚の画像で約 256 トークン、20 分のビデオで 100,000 トークン以上) に遭遇した場合、シーケンス長の 2 次分散により、高速カードと低速カードで各 GPU の実際の計算量が大きく異なります。 LoongForge は、各反復の前にサンプル割り当てを動的に再配置し、ランク間の負荷ギャップを大幅に狭めます。これは、5000 以上の Kakunlun P800 クラスターで 90% 以上の線形拡張効率を達成するための重要なサポートでもあります。モデルの異種並列処理により、Vision Transformer と LLM の間のパラメータ スケールの数百倍の違いによって引き起こされる効率の問題が解決され、最適な並列戦略を個別に構成できるようになります。 Qwen3-VL-30B の測定されたスループットは、32K シーケンスの下でコミュニティ ソリューションと比較して 45% 増加しました。 ハードウェア層のプラグイン設計は、LoongForge の差別化された利点です。 GPU 側は PyTorch/CUDA を通じてネイティブに Megatron に接続し、XPU 側は XPU_Plugin プラグインを使用して、基礎となるインターフェイスの違いをカプセル化します。同じトレーニング コードで 1 つの環境変数を変更するだけで、NVIDIA GPU と Kunlun XPU をシームレスに切り替えることができます。これは、複数のハードウェア展開にわたってトレーニングを行う必要があるチームにとって、2 セットのコードを維持する必要がなく、ハードウェアの変更によって分散ロジックを書き直す必要もないことを意味します。 ユーザーエクスペリエンスの面では、LoongForge は Megatron ユーザーの習慣を引き継いでいます。基本的なトレーニング パラメーターは Megatron と互換性があり、パイプラインとデータの並列構成スタイルは類似しています。コンポーネント レベルの独立した構成 (ビジュアル エンコーダーと言語バックボーンに異なる TP サイズを使用するなど) は、Hydra を通じて実装されます。分散トレーニングの経験があるチームにとって、これはそれほど難しいことではありません。データ前処理ツールチェーンと、HuggingFace ウェイトのオフライン変換用ツールも組み込まれています。 現在のバージョン (v0.1.0、2026 年 5 月リリース) は 20 以上のモデル ファミリをサポートしており、DeepSeek (V2/V3/V3.2/V4)、Qwen (フル シリーズ 0.6B ~ 480B)、LLaMA (2/3/3.1)、MiniMax、GLM などの主流の LLM をカバーしています。 VLM 側サポート Qwen2.5/3-VL、InternVL2.5/3.5、Kimi-K2.5/K2.6、ERNIE4.5-VL など。普及モデルは Wan2.1/2.2 および Qwen-Image をサポートします。具現化モデルは、Pi0.5、GR00T N1.6/N1.7、X-VLA、FastWAM、および複数のワールド アクション モデルをカバーします。このモデルの対象範囲は、現在、オープンソース トレーニング フレームワークの中で最も広範なものの 1 つです。

  • LoongForge は、Apache-2.0 プロトコルを使用するオープンソースです。ソースコードは無料で入手可能です。コミュニティ バージョンとエンタープライズ バージョンの間に権限の区別はありません。トレーニング インフラストラクチャとしての商用化の道は、ソフトウェア ライセンスを直接販売することではなく、Baidu Baige のコンピューティング パワー プラットフォームで LoongForge を使用するチームをさらに誘致し、Baidu Smart Cloud のコンピューティング パワー レンタルおよび AI プラットフォーム サービスの需要を促進することです。これは、以前のオープンソース AI フレームワークの一般的なビジネス モデルと一致しています。フレームワーク自体は無料であり、機能が強化され、エコシステムが大規模になるほど、上流のコンピューティング サービスへの引き寄せが強くなります。 XPU_Plugin の設計のおかげで、Baidu Kunlun コアで LoongForge を実行しているユーザーは追加の調整を行う必要がなく、NVIDIA GPU を使用しているユーザーは影響を受けません。 対象となるユーザーは比較的明確です。事前トレーニングや大規模な微調整を行っているチーム、特に言語、視覚言語、拡散、ロボット工学の 4 つの異なるトレーニング スタックを同時に維持する必要があるチームです。シングル GPU ユーザーや推論だけを行うチームにとってはあまり魅力的ではありません。これはクラスター スケールのツールによくあることです。

  • LoongForge が正式にオープンソースになってから約 3 か月が経過しましたが、コミュニティからのフィードバックはまだ蓄積の初期段階にあります。 GitHub Issues やエンジニアリング ブログでのやり取りから判断すると、技術コミュニティからの反応は概して肯定的です。 肯定的なコメントはいくつかの側面に焦点を当てています。 まず、「すべてのモードをカバーする 1 つのフレームワーク」という位置付けが、実際の問題点に当たります。ユーザーのコメントの中には、「ついに Megatron、LeRobot、拡散フレームワークの間を行ったり来たりする必要がなくなった」と述べた人もいます。 2 番目に、パフォーマンス データは比較的確実であり、サードパーティの評価サイト besthub.dev による独立した分析記事では、DSA モデルで 5 倍を超える加速パフォーマンスが認められています。 3 番目に、デュアル ハードウェア バックエンドの異なる利点は明らかであり、コミュニティの比較記事では LoongForge とみなされることがよくあります。 Megatron-LM と DeepSpeed の主な違い - 後者の 2 つは Kunlun コアでのネイティブ サポートを持っていません。 否定的なコメントや物議を醸す点も注目に値します。まず、フレームワークはまだ初期段階 (v0.1.0) にあり、一部の機能 (チェックポイント形式変換の安定性など) はまだ継続的に反復されています。 2 つ目は、インストールとデプロイメントのしきい値が高く、現在は Docker イメージまたはソース コードのコンパイルに依存しているため、エンジニアリング構成の経験が必要です。第三に、このプロジェクトには現在 150 を超えるスターしかなく、メガトロン LM の成熟度にははるかに遅れており、コミュニティ貢献エコシステムはまだ規模を形成していません。また、一部のユーザーは、この文書にはさらなる改善が必要である、特に文書の中国語版の一部の章にはまだ翻訳の痕跡があると報告しました。

  • LoongForge が置かれている AI トレーニング フレームワーク トラックは、現在いくつかの明確な層を形成しています。 LLM トレーニングの分野では、NVIDIA の Megatron-LM と Microsoft の DeepSpeed が事実上の業界標準です。前者は大規模分散トレーニングのパフォーマンスに広く採用されており、後者は ZeRO 最適化シリーズで知られています。これら 2 つのフレームワークに加えて、LLaMA-Factory、シナリオを微調整するための Axolotl、および Hugging Face エコシステムの Transformers もあります。 LoongForge の独自性は、純粋な LLM トレーニング フレームワークではなく、複数のモダリティを接続しようとする「集約」フレームワークであることです。これは、LLM ベースとして Megatron-LM の並列戦略を継承し、一般に LLM フレームワークに欠けている VLM ビジュアル コンポーネントのデカップリングと VLA に組み込まれたモデルのサポートを補完し、拡散モデルとの下位互換性があります。業界メディアの 36kr と複数のテクノロジーに関するセルフメディアのレポートは、一般に、この位置付けが「実用的」であると信じています。これは誰かに代わるものではなく、メガトロン-LM などのマルチモーダルシナリオのギャップを埋めるものであると主張しています。 LoongForge が国内のチップ エコシステムにおいて独自の地位を占めていることは注目に値します。現在、主流のオープンソース トレーニング フレームワークは一般に国産チップのサポートが弱く、LoongForge のネイティブ Kunlun XPU サポートにより、国内のコンピューティング能力シナリオでは直接の競合がほとんどありません。大規模モデルのトレーニングにおける国産チップの割合が増加し続けるにつれて、この利点はさらに増幅される可能性があります。

  • 現段階における LoongForge の主なリスクは、その成熟度にあります。 v0.1.0 バージョンはまだ初期リリースであり、展開中に一部のユーザーが遭遇した環境構成の問題はまだ完全に解決されていません。 Megatron-LM の GitHub 上の何千ものスターや大規模なコミュニティ貢献者と比較すると、LoongForge のコミュニティ生態系は成熟とは程遠く、長期的な保守と開発は Baidu Baige チームの継続的な投資に大きく依存しています。 Baidu の内部戦略的優先順位が変更された場合、フレームワークの反復リズムが影響を受ける可能性があります。 技術レベルでは、LoongForge の身体化モデル トレーニング サブシステムには明確な設計思想がありますが、身体化インテリジェンス分野自体の成熟度は依然として急速に進化しており、主流の政策モデルの標準はまだ形成されていません。これは、身体化された方向におけるフレームワークの互換性が継続的な反復のプレッシャーに直面する可能性があることを意味します。さらに、Kunlun XPU のフレームワークの最適化の深さが特定のハードウェアに暗黙的に依存しているかどうか、また、この最適化が Baidu の内部コンピューティング能力に依存せずに外部チームによって低コストで再現できるかどうかも、引き続き注目に値する問題です。

  • LoongForge が最適なチーム プロファイル: 複数のモダリティ (LLM + VLM または LLM + 拡散、またはより複雑な組み合わせ) を使用して、大規模なモデルの事前トレーニングまたは大規模な微調整を行っているチームは、複数セットのトレーニング フレームワークを維持するコストが上昇していると感じており、2 つのハードウェア プラットフォーム間で柔軟に切り替える機能を維持したいと考えています。微調整にプレーン テキスト LLM のみを使用するチームの場合、LLaMA-Factory または Hugging Face の Trainer を直接使用する方が軽量で効率的である可能性があります。チームが NVIDIA GPU のみに依存し、具体化されたモデルのトレーニングを必要としない場合は、現在のバージョンの Megatron-LM または DeepSpeed がより安全な選択となります。

  • LoongForge は、明確な位置づけと実用的な設計を備えたフルモーダル トレーニング フレームワークです。同社は、複合形式のトレーニング プロジェクトの複雑さを軽減し、国内のチップ エコシステムを開放することで差別化された価値を生み出してきました。これは「世界を征服」しようとするフレームワークではなく、マルチモーダルなシナリオで既存のテクノロジースタックのギャップを埋めることを目的としています。チームがすでにマルチモーダル トレーニングにおけるエンジニアリング コストのプレッシャーを感じている場合は、このプロジェクトに注目する価値があります。オープンソース コミュニティからの肯定的なフィードバックと継続的なバージョンの反復が、本当に産業レベルのソリューションに成長できるかどうかの重要な変数となります。

ユーザーレビュー

  • アイコン
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • アイコン
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • アイコン
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • アイコン
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • アイコン
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • アイコン
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • アイコン
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • アイコン
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • アイコン
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • アイコン
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • アイコン
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • アイコン
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • アイコン
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • アイコン
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • アイコン
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • アイコン
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • アイコン
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • アイコン
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • アイコン
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • アイコン
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • アイコン
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • アイコン
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • アイコン
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • アイコン
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • アイコン
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • アイコン
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • アイコン
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • アイコン
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • アイコン
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • アイコン
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。