LoongForge
Framework pelatihan omnimodal open source dari Baidu Baige: mencakup pelatihan LLM, VLM, model difusi, dan AI terwujud dalam satu framework terpadu, dengan dukungan native untuk GPU NVIDIA dan XPU Kunlunxin
Laporan mendalam
-
LoongForge adalah kerangka pelatihan modal penuh bersumber terbuka resmi Baidu Baige, yang berevolusi dari tumpukan akselerasi pelatihan internal AIAK-Training-LLM. Ini menggunakan kerangka terpadu untuk mencakup kebutuhan pelatihan empat mode: model bahasa besar (LLM), model bahasa visual (VLM), model difusi (Diffusion) dan kecerdasan yang diwujudkan (Embodied). Produk ini mencapai akselerasi pelatihan end-to-end sebesar 15%–50% pada model mainstream, dan secara native mendukung platform perangkat keras ganda NVIDIA GPU dan Kunlun XPU. Kerangka kerja ini telah mengalami validasi produksi skala besar dengan pelanggan perusahaan di bidang pendidikan, visi komputer, dan kecerdasan yang diwujudkan, dengan ukuran cluster maksimum lebih dari 5.000 akselerator, dan bersifat open source menggunakan protokol Apache-2.0.
-
Pendahulu LoongForge adalah AIAK-Training-LLM, kerangka akselerasi pelatihan jangka panjang yang digunakan secara internal oleh Baidu Baige. Sebelum secara resmi menjadi open source, ia telah lulus uji tingkat produksi di antara pelanggan perusahaan di berbagai industri - pelatihan model dalam skenario pendidikan, tugas multi-modal dalam visi komputer, dan model kecerdasan VLA (Visual-Language-Action) yang diwujudkan semuanya telah diterapkan. Pada bulan April 2026, Baidu Baige memutuskan untuk secara resmi menjadikannya open source dan menamakannya LoongForge, bergabung dengan seri open source Baige Loong, menggemakan LoongFlow (kerangka pemikiran dan pembelajaran untuk agen ahli AI) dari seri yang sama. Nama “LoongForge” diambil dari perahu naga tradisional Tiongkok yang berarti bekerja sama memecah ombak. Pada Juli 2026, repositori GitHub-nya memiliki lebih dari 150 bintang dan mempertahankan aktivitas komunitas tingkat tinggi. Blog teknik tim secara rutin memperbarui artikel teknis yang mendalam, mencakup topik seperti pelatihan paralel heterogen, penyeimbangan beban DP, akselerasi model VLA, dll. Kontennya berkualitas tinggi, menunjukkan bahwa tim proyek terus berinvestasi dalam teknologi.
-
Penempatan inti LoongForge jelas: satu kerangka kerja, empat mode. Arsitekturnya dibagi menjadi tiga lapisan - lapisan model bertanggung jawab atas abstraksi terpadu, lapisan sistem berfokus pada pengoptimalan ujung ke ujung, dan lapisan perangkat keras menyelesaikan adaptasi lintas platform. Pada lapisan model, LoongForge membangun lapisan abstraksi model di atas Megatron-LM, menguraikan model multi-modal menjadi tiga bagian: lapisan pengkodean persepsi (Encoder), lapisan tulang punggung pembangkitan (Foundation), dan lapisan penjadwalan gabungan. Untuk mengakses model baru, Anda hanya perlu mendaftarkan komponen yang sesuai, lalu menyelesaikan penyambungan modul dan konfigurasi strategi paralel melalui file konfigurasi YAML tanpa menulis ulang kode yang mendasarinya. Dalam pengujian sebenarnya, tim hanya membutuhkan beberapa hari untuk mengadaptasi encoder visual baru LLaVA-OneVision, RICE-ViT. Dibandingkan dengan siklus adaptasi solusi tradisional yang memakan waktu beberapa minggu, terdapat kesenjangan yang signifikan. Jika Anda ingin mengganti tulang punggung bahasa Qwen3.5 dengan DeepSeek V3, Anda hanya perlu mengubah jalur referensi YAML dalam satu baris. Tidak perlu membagi seluruh gudang. Optimalisasi pada level sistem lebih intensif. Untuk basis LLM, LoongForge mengimplementasikan penghitungan CCT dan paralelisme transmisi, dan secara seragam mengatur penghitungan, komunikasi, dan transmisi data model MoE dalam pelatihan urutan panjang. Kinerja pelatihan Qwen3-30B-A3B yang diukur meningkat sebesar 16% di bawah panjang urutan 32K. Paralelisme pipeline ChunkPipe memecahkan hambatan memori pada rangkaian yang sangat panjang, memungkinkan jutaan jendela konteks dijalankan pada klaster berukuran kecil dan menengah. Untuk arsitektur perhatian jarang DSA DeepSeek V3.2, LoongForge telah melakukan fusi dan pengoptimalan operator yang mendalam pada seluruh tautan penghitungan perhatian, sehingga meningkatkan kinerja ujung ke ujung sekitar 5 kali lipat. Di sisi optimasi multimodal, mekanisme penyeimbangan beban DP sangat penting. Ketika paralelisme data tradisional bertemu dengan data multi-modal dengan panjang yang sangat tidak rata (sekitar 256 token untuk satu gambar, dan lebih dari 100.000 token untuk video berdurasi 20 menit), varian kuadrat dari panjang urutan akan menyebabkan jumlah penghitungan sebenarnya dari setiap GPU menjadi sangat berbeda, dengan kartu cepat dan kartu lambat. LoongForge secara dinamis mengatur ulang alokasi sampel sebelum setiap iterasi, sehingga secara signifikan mempersempit kesenjangan beban antar peringkat. Hal ini juga merupakan dukungan utama untuk mencapai efisiensi ekspansi linier 90%+ pada cluster 5000+ Kakunlun P800.Model paralelisme heterogen memecahkan masalah efisiensi yang disebabkan oleh perbedaan ratusan kali lipat dalam skala parameter antara Vision Transformer dan LLM, memungkinkan mereka untuk secara mandiri mengonfigurasi strategi paralel yang optimal. Throughput terukur Qwen3-VL-30B meningkat sebesar 45% dibandingkan dengan solusi komunitas di bawah rangkaian 32K. Desain plug-in pada lapisan perangkat keras merupakan keunggulan berbeda dari LoongForge. Sisi GPU terhubung ke Megatron secara asli melalui PyTorch/CUDA, dan sisi XPU menggunakan plug-in XPU_Plugin untuk merangkum perbedaan antarmuka yang mendasarinya. Kode pelatihan yang sama hanya perlu mengubah satu variabel lingkungan untuk beralih secara mulus antara GPU NVIDIA dan Kunlun XPU. Untuk tim yang perlu melakukan pelatihan di seluruh penerapan perangkat keras, ini berarti tidak perlu mempertahankan dua set kode, dan tidak perlu menulis ulang logika terdistribusi karena perubahan perangkat keras. Dalam hal pengalaman pengguna, LoongForge melanjutkan kebiasaan pengguna Megatron. Parameter pelatihan dasar kompatibel dengan Megatron, dan gaya konfigurasi pipa dan paralel data serupa. Konfigurasi independen tingkat komponen (seperti menggunakan ukuran TP berbeda untuk encoder visual dan tulang punggung bahasa)
-
LoongForge adalah open source menggunakan protokol Apache-2.0. Kode sumbernya gratis dan tersedia. Tidak ada perbedaan izin antara versi komunitas dan versi perusahaan. Sebagai infrastruktur pelatihan, jalur komersialisasinya bukan dengan menjual lisensi perangkat lunak secara langsung, namun untuk menarik lebih banyak tim agar menggunakan LoongForge pada platform daya komputasi Baidu Baige, sehingga mendorong permintaan akan penyewaan daya komputasi dan layanan platform AI Baidu Smart Cloud. Hal ini konsisten dengan model bisnis umum kerangka kerja AI open source sebelumnya - kerangka kerja itu sendiri gratis, dan semakin kuat kapabilitasnya serta semakin besar ekosistemnya, semakin kuat daya tariknya terhadap layanan komputasi upstream. Berkat desain XPU_Plugin, pengguna yang menjalankan LoongForge pada inti Baidu Kunlun tidak perlu melakukan adaptasi tambahan, dan pengguna yang menggunakan GPU NVIDIA tidak terpengaruh. Target penggunanya relatif jelas: tim yang melakukan pra-pelatihan atau penyesuaian skala besar, terutama mereka yang terpaksa mempertahankan empat rangkaian pelatihan berbeda untuk bahasa, visual-linguistik, difusi, dan robotika pada saat yang bersamaan. Ini memiliki sedikit daya tarik bagi pengguna GPU tunggal atau tim yang hanya melakukan inferensi - ini merupakan ciri khas alat skala cluster.
-
Sudah sekitar tiga bulan sejak LoongForge resmi menjadi open source, dan masukan dari komunitas masih dalam tahap awal akumulasi. Dilihat dari interaksi di GitHub Issues dan blog teknik, reaksi dari komunitas teknis secara umum positif. Komentar positif tersebut berfokus pada beberapa aspek: Pertama, pemosisian "satu kerangka kerja yang mencakup semua mode" menyentuh titik permasalahan yang sebenarnya. Beberapa komentar pengguna menyebutkan bahwa "akhirnya tidak perlu beralih antara Megatron, LeRobot, dan kerangka kerja difusi"; kedua, data kinerjanya relatif solid, dan artikel analisis independen oleh situs evaluasi pihak ketiga besthub.dev mengakui kinerja akselerasinya lebih dari 5 kali lipat pada model DSA; ketiga, keunggulan diferensial dari backend perangkat keras ganda sudah jelas, dan sering dianggap sebagai LoongForge dalam artikel perbandingan komunitas. Perbedaan inti antara Megatron-LM dan DeepSpeed - dua yang terakhir tidak memiliki dukungan asli pada inti Kunlun. Komentar negatif dan poin kontroversial juga patut mendapat perhatian: Pertama, kerangka kerja ini masih dalam tahap awal (v0.1.0), dan beberapa fungsi (seperti stabilitas konversi format pos pemeriksaan) masih dalam iterasi berkelanjutan; kedua, ambang instalasi dan penerapannya tinggi, dan saat ini bergantung pada image Docker atau kompilasi kode sumber, yang memerlukan pengalaman konfigurasi teknik tertentu; ketiga, proyek tersebut saat ini hanya memiliki lebih dari 150 bintang, jauh tertinggal dari kematangan Megatron-LM, dan ekosistem kontribusi masyarakat belum terbentuk skalanya. Beberapa pengguna juga melaporkan bahwa dokumen tersebut memerlukan perbaikan lebih lanjut, terutama beberapa bab dari dokumen versi Mandarin masih memiliki jejak terjemahan.
-
Jalur kerangka pelatihan AI tempat LoongForge berada kini telah membentuk beberapa lapisan yang jelas. Di bidang pelatihan LLM, Megatron-LM dari NVIDIA dan DeepSpeed Microsoft adalah standar industri de facto. Yang pertama telah diadopsi secara luas untuk kinerja pelatihan terdistribusi skala besar, dan yang terakhir dikenal dengan seri optimasi ZeRO-nya. Selain kedua framework tersebut, ada juga LLaMA-Factory, Axolotl untuk fine-tuning skenario, dan ekosistem Transformers of the Hugging Face. Keunikan LoongForge adalah bahwa ini bukan kerangka pelatihan LLM murni, namun kerangka "agregasi" yang mencoba menghubungkan berbagai modalitas. Ini mewarisi strategi paralel Megatron-LM sebagai basis LLM, melengkapi pemisahan komponen visual VLM dan dukungan model yang diwujudkan VLA yang umumnya tidak ada dalam kerangka LLM, dan kompatibel dengan model difusi. Media industri 36kr dan laporan media mandiri berbagai teknologi umumnya percaya bahwa posisi ini "pragmatis" - tidak mengklaim untuk menggantikan siapa pun, tetapi untuk mengisi kesenjangan dalam skenario multi-modal seperti Megatron-LM. Perlu dicatat bahwa LoongForge menempati posisi unik dalam ekosistem chip domestik. Saat ini, kerangka kerja pelatihan open source arus utama umumnya memiliki dukungan yang lemah untuk chip domestik, dan dukungan asli LoongForge, yaitu Kunlun XPU, membuatnya hampir tidak memiliki persaingan langsung dalam skenario daya komputasi domestik. Keuntungan ini dapat semakin diperkuat karena proporsi chip dalam negeri dalam pelatihan model besar terus meningkat.
-
Risiko utama LoongForge pada tahap ini berasal dari kematangannya. Versi v0.1.0 masih merupakan rilis awal, dan masalah konfigurasi lingkungan yang dihadapi oleh beberapa pengguna selama penerapan belum sepenuhnya dipahami. Dibandingkan dengan ribuan bintang Megatron-LM di GitHub dan kontributor komunitas dalam skala besar, ekologi komunitas LoongForge masih jauh dari matang, dan pemeliharaan serta pengembangan jangka panjang sangat bergantung pada investasi berkelanjutan dari tim Baidu Baige. Jika prioritas strategis internal Baidu berubah, ritme pengulangan kerangka kerja tersebut mungkin akan terpengaruh. Pada tingkat teknis, meskipun subsistem pelatihan model yang diwujudkan LoongForge memiliki ide desain yang jelas, kematangan bidang intelijen yang diwujudkan itu sendiri masih berkembang pesat, dan standar untuk model kebijakan arus utama belum terbentuk, yang berarti bahwa kompatibilitas kerangka kerja dalam arah yang diwujudkan mungkin menghadapi tekanan pengulangan yang berkelanjutan. Selain itu, apakah kedalaman optimalisasi kerangka kerja Kunlun XPU memiliki ketergantungan implisit pada perangkat keras tertentu, dan apakah pengoptimalan ini dapat direproduksi oleh tim eksternal dengan biaya rendah tanpa bergantung pada daya komputasi internal Baidu, juga merupakan isu yang patut untuk terus mendapat perhatian.
-
Profil tim yang paling cocok untuk LoongForge: mereka yang melakukan pra-pelatihan model skala besar atau penyempurnaan skala besar, menggunakan berbagai modalitas (difusi LLM + VLM atau LLM + atau kombinasi yang lebih kompleks), merasa bahwa biaya pemeliharaan beberapa rangkaian kerangka pelatihan meningkat, dan ingin mempertahankan kemampuan untuk beralih secara fleksibel di antara dua platform perangkat keras. Bagi tim yang hanya menggunakan LLM teks biasa untuk fine-tuning, mungkin akan lebih ringan dan efisien jika langsung menggunakan LLaMA-Factory atau Hugging Face's Trainer. Jika sebuah tim hanya mengandalkan GPU NVIDIA dan tidak memerlukan pelatihan model yang diwujudkan, versi Megatron-LM atau DeepSpeed saat ini tetap menjadi pilihan yang lebih aman.
-
LoongForge adalah kerangka pelatihan modal lengkap dengan posisi yang jelas dan desain pragmatis. Hal ini telah memberikan nilai yang berbeda dalam mengurangi kompleksitas proyek pelatihan multi-modal dan membuka ekosistem chip dalam negeri. Ini bukan kerangka kerja yang mencoba untuk "menaklukkan dunia", namun untuk mengisi kesenjangan dalam tumpukan teknologi yang ada dalam skenario multimodal. Jika tim sudah merasakan tekanan biaya teknik dalam pelatihan multimodal, proyek ini layak untuk diperhatikan. Umpan balik positif dari komunitas open source dan iterasi versi yang berkelanjutan akan menjadi variabel kunci apakah ini benar-benar dapat berkembang menjadi solusi tingkat industri.
Ulasan pengguna
-
kqreqlob—LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。 -
DogeDadWalker—终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。 -
MiningMoleFoster—昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。 -
DomingoGonzález—文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。 -
Stephen_Fisher2—apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。 -
Diana.StewartK—换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。 -
bigrabbit734—粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。 -
StephenSmith_Pro601—DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。 -
VerbanShulga vasil—LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。 -
石飞—CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。 -
Sean.Stewart520399—v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。 -
xLauraPáez_dev—我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。 -
ZLong_889—ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。 -
Betty.EvansSr567—看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。 -
Timothy_WilsonJr—同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。 -
Cole397_r—Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。 -
tinygoose585—项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。 -
SGonzales—如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。 -
GregoryMartin_2020—跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。 -
xJesusGrant_dev—自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。 -
Russell_Robinson369—DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。 -
Jude665—总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。 -
x_7kpq611—有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。 -
StephanieWalker_2023—具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。 -
KimberlyLee—作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。 -
FrankLong—测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。 -
TSmith_88—能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。 -
Alan.Price007—自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。 -
DVasquez_2021—搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。 -
RHughes_7718—虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。