LoongForge
Framework d'entraînement omnimodal open source de Baidu Baige : couvre l'entraînement des LLM, VLM, modèles de diffusion et IA incarnée dans un cadre unifié, avec prise en charge native des GPU NVIDIA et des XPU Kunlunxin
Rapport détaillé
-
LoongForge est le cadre de formation entièrement modal récemment officiellement open source de Baidu Baige, qui a évolué à partir de la pile d'accélération de formation interne AIAK-Training-LLM. Il utilise un cadre unifié pour couvrir les besoins de formation de quatre modes : grand modèle de langage (LLM), modèle de langage visuel (VLM), modèle de diffusion (Diffusion) et intelligence incarnée (Emboded). Il atteint une accélération de formation de bout en bout de 15 à 50 % sur les modèles grand public et prend en charge nativement les plates-formes matérielles doubles NVIDIA GPU et Kunlun XPU. Le framework a fait l'objet d'une validation de production à grande échelle auprès d'entreprises clientes dans les domaines de l'éducation, de la vision par ordinateur et de l'intelligence incorporée, avec une taille de cluster maximale de plus de 5 000 accélérateurs, et est open source utilisant le protocole Apache-2.0.
-
Le prédécesseur de LoongForge est AIAK-Training-LLM, le cadre d'accélération de la formation à long terme utilisé en interne par Baidu Baige. Avant d'être officiellement open source, il avait déjà résisté à des tests de niveau production auprès d'entreprises clientes de plusieurs secteurs : formation sur modèles dans des scénarios éducatifs, tâches multimodales en vision par ordinateur et modèles d'intelligence incorporée VLA (Visual-Language-Action) ont tous été mis en œuvre. En avril 2026, Baidu Baige a décidé de l'ouvrir officiellement et l'a nommé LoongForge, rejoignant la série open source Baige Loong, faisant écho au LoongFlow (un cadre de réflexion et d'apprentissage pour les agents experts en IA) de la même série. Le nom « LoongForge » vient du bateau-dragon traditionnel chinois, qui signifie travailler ensemble pour briser les vagues. Depuis juillet 2026, son référentiel GitHub compte plus de 150 étoiles et maintient un niveau élevé d'activité communautaire. Le blog d'ingénierie de l'équipe met régulièrement à jour des articles techniques approfondis, couvrant des sujets tels que la formation parallèle hétérogène, l'équilibrage de charge DP, l'accélération du modèle VLA, etc. Le contenu est de haute qualité, indiquant que l'équipe du projet a continué à investir dans la technologie.
-
Le positionnement principal de LoongForge est clair : un framework, quatre modes. Son architecture est divisée en trois couches : la couche modèle est responsable de l'abstraction unifiée, la couche système se concentre sur l'optimisation de bout en bout et la couche matérielle résout l'adaptation multiplateforme. Au niveau de la couche modèle, LoongForge a construit une couche d'abstraction de modèle au-dessus de Megatron-LM, décomposant le modèle multimodal en trois parties : la couche de codage perceptuel (Encoder), la couche de base de génération (Foundation) et la couche de planification combinée. Pour accéder à un nouveau modèle, il vous suffit d'enregistrer les composants correspondants, puis de terminer l'épissage des modules et la configuration de la stratégie parallèle via un fichier de configuration YAML sans réécrire le code sous-jacent. Lors du test réel, il n'a fallu que quelques jours à l'équipe pour adapter le nouvel encodeur visuel RICE-ViT de LLaVA-OneVision. Par rapport au cycle d'adaptation de plusieurs semaines de la solution traditionnelle, il y avait un écart important. Si vous souhaitez remplacer le squelette du langage de Qwen3.5 par DeepSeek V3, il vous suffit de modifier le chemin de référence YAML sur une seule ligne. Il n’est pas nécessaire de diviser tout l’entrepôt. L'optimisation au niveau du système est plus intensive. Pour la base LLM, LoongForge implémente le parallélisme de calcul et de transmission CCT, et orchestre uniformément le calcul, la communication et la transmission de données du modèle MoE dans le cadre d'une formation à séquence longue. Les performances d'entraînement Qwen3-30B-A3B mesurées ont augmenté de 16 % sous la longueur de la séquence de 32 000 km. Le parallélisme du pipeline ChunkPipe résout le goulot d'étranglement de la mémoire des séquences ultra longues, permettant à des millions de fenêtres contextuelles de s'exécuter sur des clusters de petite et moyenne taille. Pour l'architecture d'attention clairsemée DSA de DeepSeek V3.2, LoongForge a effectué une fusion et une optimisation approfondies des opérateurs sur l'ensemble du lien de calcul de l'attention, améliorant ainsi les performances de bout en bout d'environ 5 fois. Du côté de l'optimisation multimodale, le mécanisme d'équilibrage de charge DP est particulièrement critique. Lorsque le parallélisme de données traditionnel rencontre des données multimodales de longueurs extrêmement inégales (environ 256 jetons pour une seule image et plus de 100 000 jetons pour une vidéo de 20 minutes), la variance quadratique de la longueur de la séquence entraînera une quantité de calcul réelle de chaque GPU très différente, avec une carte rapide et une carte lente. LoongForge réorganise dynamiquement l'allocation des échantillons avant chaque itération, réduisant ainsi considérablement l'écart de charge entre les rangs. Il s'agit également d'un support clé pour atteindre une efficacité d'expansion linéaire de plus de 90 % sur un cluster Kakunlun P800 de plus de 5 000.Le parallélisme hétérogène des modèles résout le problème d'efficacité causé par la différence de plusieurs centaines de fois dans l'échelle des paramètres entre Vision Transformer et LLM, leur permettant de configurer indépendamment des stratégies parallèles optimales. Le débit mesuré de Qwen3-VL-30B a augmenté de 45 % par rapport à la solution communautaire sous la séquence 32K. La conception plug-in de la couche matérielle est un avantage différencié de LoongForge. Le côté GPU se connecte à Megatron de manière native via PyTorch/CUDA, et le côté XPU utilise le plug-in XPU_Plugin pour encapsuler les différences d'interface sous-jacentes. Le même code de formation n'a besoin de modifier qu'une seule variable d'environnement pour basculer de manière transparente entre le GPU NVIDIA et Kunlun XPU. Pour les équipes qui doivent suivre une formation sur les déploiements matériels, cela signifie qu’il n’est pas nécessaire de conserver deux ensembles de codes ni de
-
LoongForge est open source utilisant le protocole Apache-2.0. Le code source est gratuit et disponible. Il n'y a aucune distinction d'autorisation entre la version communautaire et la version entreprise. En tant qu'infrastructure de formation, sa voie de commercialisation ne consiste pas à vendre directement des licences logicielles, mais à attirer davantage d'équipes pour utiliser LoongForge sur la plate-forme de puissance de calcul de Baidu Baige, stimulant ainsi la demande pour les services de location de puissance de calcul et de plate-forme d'IA de Baidu Smart Cloud. Ceci est cohérent avec le modèle économique commun des précédents frameworks d'IA open source : le framework lui-même est gratuit, et plus les capacités sont fortes et plus l'écosystème est vaste, plus l'attrait pour les services informatiques en amont est fort. Grâce à la conception de XPU_Plugin, les utilisateurs exécutant LoongForge sur le noyau Baidu Kunlun n'ont pas besoin de procéder à des adaptations supplémentaires et les utilisateurs utilisant des GPU NVIDIA ne sont pas affectés. Les utilisateurs cibles sont relativement clairs : des équipes effectuant des pré-formations ou des mises au point à grande échelle, notamment celles qui ont été contraintes de maintenir simultanément quatre stacks de formation différents pour le langage, le visuo-linguistique, la diffusion et la robotique. Il est peu attrayant pour les utilisateurs d'un seul GPU ou pour les équipes effectuant uniquement des inférences - c'est typique des outils à l'échelle d'un cluster.
-
Cela fait environ trois mois que LoongForge est officiellement open source, et les commentaires de la communauté en sont encore aux premiers stades d'accumulation. À en juger par les interactions sur les problèmes GitHub et les blogs d'ingénierie, la réaction de la communauté technique est généralement positive. Les commentaires positifs se concentrent sur plusieurs aspects : Premièrement, le positionnement d’un « cadre unique couvrant tous les modes » touche le véritable problème. Certains commentaires d'utilisateurs mentionnent qu'« enfin, il n'est pas nécessaire de basculer entre Megatron, LeRobot et les frameworks de diffusion » ; Deuxièmement, les données de performances sont relativement solides et un article d'analyse indépendant du site d'évaluation tiers besthub.dev a reconnu ses performances d'accélération plus de 5 fois supérieures sur le modèle DSA ; troisièmement, les avantages différentiels du double backend matériel sont évidents et sont souvent considérés comme LoongForge dans les articles de comparaison de la communauté. La principale différence entre Megatron-LM et DeepSpeed est que les deux derniers n'ont pas de support natif sur les cœurs Kunlun. Les commentaires négatifs et les points controversés méritent également l'attention : premièrement, le framework en est encore à ses débuts (v0.1.0), et certaines fonctions (telles que la stabilité de la conversion du format de point de contrôle) sont encore en itération continue ; deuxièmement, le seuil d'installation et de déploiement est élevé et repose actuellement sur des images Docker ou sur la compilation de code source, ce qui nécessite une certaine expérience en configuration technique ; troisièmement, le projet ne compte actuellement que plus de 150 étoiles, ce qui est loin de la maturité de Megatron-LM, et l'écosystème de contribution communautaire n'a pas encore atteint une échelle. Certains utilisateurs ont également signalé que le document devait encore être amélioré, notamment que certains chapitres de la version chinoise du document comportent encore des traces de traduction.
-
La piste du cadre de formation en IA où se trouve LoongForge a désormais formé plusieurs couches claires. Dans le domaine de la formation LLM, le Megatron-LM de NVIDIA et le DeepSpeed de Microsoft sont les standards de facto de l'industrie. Le premier a été largement adopté pour la réalisation de formations distribuées à grande échelle, et le second est connu pour sa série d'optimisation ZeRO. En plus de ces deux frameworks, il existe également LLaMA-Factory, Axolotl pour peaufiner les scénarios, et l'écosystème Transformers of the Hugging Face. La particularité de LoongForge est qu'il ne s'agit pas d'un pur cadre de formation LLM, mais d'un cadre « d'agrégation » qui tente de connecter plusieurs modalités. Il hérite de la stratégie parallèle de Megatron-LM comme base LLM, complète le découplage des composants visuels VLM et la prise en charge du modèle incorporé VLA qui manquent généralement dans le cadre LLM, et est rétrocompatible avec le modèle de diffusion. Les médias industriels 36kr et les multiples rapports des médias technologiques estiment généralement que ce positionnement est "pragmatique" - il ne prétend pas remplacer qui que ce soit, mais combler les lacunes des scénarios multimodaux tels que Megatron-LM. Il convient de noter que LoongForge occupe une position unique dans l’écosystème national des puces. À l’heure actuelle, les principaux cadres de formation open source prennent généralement en charge faiblement les puces nationales, et la prise en charge native du Kunlun XPU de LoongForge le rend presque sans concurrence directe dans les scénarios de puissance de calcul nationaux. Cet avantage pourrait être encore amplifié à mesure que la proportion de puces nationales dans la formation des grands modèles continue d'augmenter.
-
Le principal risque de LoongForge à ce stade vient de sa maturité. La version v0.1.0 est encore une version précoce et les problèmes de configuration de l'environnement rencontrés par certains utilisateurs lors du déploiement n'ont pas encore été entièrement digérés. Comparée aux milliers d'étoiles de Megatron-LM sur GitHub et à l'énorme nombre de contributeurs communautaires, l'écologie communautaire de LoongForge est loin d'être mature, et la maintenance et le développement à long terme dépendent fortement de l'investissement continu de l'équipe de Baidu Baige. Si les priorités stratégiques internes de Baidu changent, le rythme d'itération du cadre pourrait être affecté. Au niveau technique, bien que le sous-système de formation des modèles incarnés de LoongForge ait une idée de conception claire, la maturité du domaine du renseignement incarné lui-même continue d'évoluer rapidement et les normes des modèles politiques traditionnels n'ont pas encore été établies, ce qui signifie que la compatibilité du cadre dans la direction incarnée peut faire face à la pression d'itérations continues. En outre, la question de savoir si la profondeur d'optimisation du framework Kunlun XPU dépend implicitement d'un matériel spécifique et si cette optimisation peut être reproduite par une équipe externe à faible coût sans compter sur la puissance de calcul interne de Baidu sont également des questions qui méritent une attention continue.
-
Le profil d'équipe auquel LoongForge convient le mieux : ceux qui effectuent une pré-formation de modèles à grande échelle ou un réglage fin à grande échelle, en utilisant plusieurs modalités (LLM + VLM ou LLM + diffusion ou des combinaisons plus complexes), ont estimé que le coût de maintenance de plusieurs ensembles de cadres de formation augmente et souhaitent conserver la possibilité de basculer de manière flexible entre deux plates-formes matérielles. Pour les équipes qui utilisent uniquement le LLM en texte brut pour le réglage fin, il peut être plus léger et efficace d'utiliser directement LLaMA-Factory ou Hugging Face's Trainer. Si une équipe s'appuie uniquement sur les GPU NVIDIA et ne nécessite pas de formation sur des modèles incorporés, la version actuelle de Megatron-LM ou DeepSpeed reste un choix plus sûr.
-
LoongForge est un cadre de formation entièrement modal avec un positionnement clair et une conception pragmatique. Il a apporté une valeur différenciée en réduisant la complexité des projets de formation multimodaux et en ouvrant l'écosystème national des puces. Il ne s'agit pas d'un cadre qui tente de « conquérir le monde », mais de combler les lacunes de la pile technologique existante dans des scénarios multimodaux. Si les équipes ressentent déjà la pression des coûts d’ingénierie dans les formations multimodales, ce projet mérite d’être surveillé. Les retours positifs de la communauté open source et l’itération continue des versions seront des variables clés pour déterminer si elle peut véritablement devenir une solution de niveau industriel.
Avis des utilisateurs
-
kqreqlob—LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。 -
DogeDadWalker—终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。 -
MiningMoleFoster—昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。 -
DomingoGonzález—文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。 -
Stephen_Fisher2—apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。 -
Diana.StewartK—换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。 -
bigrabbit734—粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。 -
StephenSmith_Pro601—DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。 -
VerbanShulga vasil—LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。 -
石飞—CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。 -
Sean.Stewart520399—v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。 -
xLauraPáez_dev—我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。 -
ZLong_889—ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。 -
Betty.EvansSr567—看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。 -
Timothy_WilsonJr—同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。 -
Cole397_r—Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。 -
tinygoose585—项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。 -
SGonzales—如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。 -
GregoryMartin_2020—跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。 -
xJesusGrant_dev—自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。 -
Russell_Robinson369—DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。 -
Jude665—总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。 -
x_7kpq611—有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。 -
StephanieWalker_2023—具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。 -
KimberlyLee—作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。 -
FrankLong—测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。 -
TSmith_88—能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。 -
Alan.Price007—自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。 -
DVasquez_2021—搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。 -
RHughes_7718—虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。