LoongForge
Framework de entrenamiento omnimodal de código abierto de Baidu Baige: cubre el entrenamiento de LLM, VLM, modelos de difusión e IA encarnada en un único framework unificado, con soporte nativo para GPU NVIDIA y XPU Kunlunxin
Informe detallado
-
LoongForge es el marco de capacitación modal completo de código abierto recientemente oficialmente de Baidu Baige, que evolucionó a partir de la pila de aceleración de capacitación interna AIAK-Training-LLM. Utiliza un marco unificado para cubrir las necesidades de capacitación de cuatro modos: modelo de lenguaje grande (LLM), modelo de lenguaje visual (VLM), modelo de difusión (Diffusion) e inteligencia incorporada (Embodied). Logra una aceleración del entrenamiento de un 15 % a un 50 % de un extremo a otro en los modelos convencionales y es compatible de forma nativa con las plataformas de hardware dual NVIDIA GPU y Kunlun XPU. El marco ha experimentado una validación de producción a gran escala con clientes empresariales en los campos de la educación, la visión por computadora y la inteligencia incorporada, con un tamaño de clúster máximo de más de 5000 aceleradores y es de código abierto que utiliza el protocolo Apache-2.0.
-
El predecesor de LoongForge es AIAK-Training-LLM, el marco de aceleración del entrenamiento a largo plazo utilizado internamente por Baidu Baige. Antes de que fuera oficialmente de código abierto, ya había resistido pruebas de nivel de producción entre clientes empresariales en múltiples industrias: se han implementado capacitación de modelos en escenarios educativos, tareas multimodales en visión por computadora y modelos VLA (Visual-Language-Action) de inteligencia incorporada. En abril de 2026, Baidu Baige decidió abrirlo oficialmente y lo llamó LoongForge, uniéndose a la serie de código abierto Baige Loong, haciéndose eco de LoongFlow (un marco de pensamiento y aprendizaje para agentes expertos en IA) de la misma serie. El nombre "LoongForge" proviene del tradicional barco dragón chino, que significa trabajar juntos para romper las olas. A julio de 2026, su repositorio GitHub cuenta con más de 150 estrellas y mantiene un alto nivel de actividad comunitaria. El blog de ingeniería del equipo actualiza periódicamente artículos técnicos en profundidad, que cubren temas como entrenamiento paralelo heterogéneo, equilibrio de carga DP, aceleración del modelo VLA, etc. El contenido es de alta calidad, lo que indica que el equipo del proyecto ha seguido invirtiendo en tecnología.
-
El posicionamiento central de LoongForge es claro: un marco, cuatro modos. Su arquitectura se divide en tres capas: la capa de modelo es responsable de la abstracción unificada, la capa de sistema se centra en la optimización de un extremo a otro y la capa de hardware resuelve la adaptación multiplataforma. En la capa del modelo, LoongForge construyó una capa de abstracción del modelo sobre Megatron-LM, descomponiendo el modelo multimodal en tres partes: la capa de codificación perceptual (Encoder), la capa troncal de generación (Foundation) y la capa de programación combinada. Para acceder a un nuevo modelo, solo necesita registrar los componentes correspondientes y luego completar el empalme del módulo y la configuración de la estrategia paralela a través de un archivo de configuración YAML sin reescribir el código subyacente. En la prueba real, al equipo solo le llevó unos días adaptar el nuevo codificador visual RICE-ViT de LLaVA-OneVision. En comparación con el ciclo de adaptación de varias semanas de la solución tradicional, hubo una brecha significativa. Si desea reemplazar la columna vertebral del idioma de Qwen3.5 con DeepSeek V3, solo necesita cambiar la ruta de referencia YAML en una línea. No es necesario bifurcar todo el almacén. La optimización a nivel del sistema es más intensiva. Para la base LLM, LoongForge implementa el cálculo CCT y el paralelismo de transmisión, y organiza de manera uniforme el cálculo, la comunicación y la transmisión de datos del modelo MoE en un entrenamiento de secuencia larga. El rendimiento del entrenamiento Qwen3-30B-A3B medido aumentó en un 16% con la longitud de la secuencia de 32K. El paralelismo de canalización de ChunkPipe resuelve el cuello de botella de memoria de secuencias ultralargas, permitiendo que millones de ventanas de contexto se ejecuten en clústeres pequeños y medianos. Para la arquitectura de atención dispersa DSA de DeepSeek V3.2, LoongForge ha realizado una profunda fusión y optimización de operadores en todo el enlace de cálculo de atención, mejorando el rendimiento de un extremo a otro aproximadamente 5 veces. En el lado de la optimización multimodal, el mecanismo de equilibrio de carga de DP es particularmente crítico. Cuando el paralelismo de datos tradicional encuentra datos multimodales con longitudes extremadamente desiguales (aproximadamente 256 tokens para una sola imagen y más de 100.000 tokens para un video de 20 minutos), la variación cuadrática de la longitud de la secuencia hará que la cantidad de cálculo real de cada GPU sea muy diferente, con una tarjeta rápida y una tarjeta lenta. LoongForge reorganiza dinámicamente la asignación de muestras antes de cada iteración, reduciendo significativamente la brecha de carga entre rangos. Este también es un soporte clave para lograr una eficiencia de expansión lineal superior al 90% en un clúster Kakunlun P800 de más de 5000.El paralelismo heterogéneo del modelo resuelve el problema de eficiencia causado por la diferencia de cientos de veces en la escala de parámetros entre Vision Transformer y LLM, permitiéndoles configurar de forma independiente estrategias paralelas óptimas. El rendimiento medido de Qwen3-VL-30B aumentó en un 45% en comparación con la solución comunitaria en la secuencia de 32K. El diseño enchufable de la capa de hardware es una ventaja diferenciadora de LoongForge. El lado de la GPU se conecta a Megatron de forma nativa a través de PyTorch/CUDA, y el lado de la XPU utiliza el complemento XPU_Plugin para encapsular las diferencias de interfaz subyacentes. El mismo código de entrenamiento solo necesita cambiar una variable de entorno para cambiar sin problemas entre NVIDIA GPU y Kunlun XPU. Para los equipos que necesitan realizar capacitación en implementaciones de hardware, esto significa que no es necesario mantener dos conjuntos de códigos ni reescribir la lógica distribuida debido a cambios de hardware. En términos de experiencia de usuario, LoongForge continúa los hábitos de
-
LoongForge es de código abierto y utiliza el protocolo Apache-2.0. El código fuente es gratuito y está disponible. No hay distinción de permisos entre la versión comunitaria y la versión empresarial. Como infraestructura de capacitación, su camino de comercialización no es vender directamente licencias de software, sino atraer más equipos para que utilicen LoongForge en la plataforma de potencia informática de Baidu Baige, impulsando la demanda de los servicios de plataforma de IA y alquiler de potencia informática de Baidu Smart Cloud. Esto es consistente con el modelo de negocio común de los marcos de IA de código abierto anteriores: el marco en sí es gratuito y cuanto más fuertes sean las capacidades y más grande sea el ecosistema, mayor será la atracción por los servicios informáticos ascendentes. Gracias al diseño de XPU_Plugin, los usuarios que ejecutan LoongForge en el núcleo Baidu Kunlun no necesitan realizar adaptaciones adicionales y los usuarios que utilizan GPU NVIDIA no se ven afectados. Los usuarios objetivo son relativamente claros: equipos que realizan una formación previa o un ajuste a gran escala, especialmente aquellos que se han visto obligados a mantener cuatro pilas de formación diferentes para lenguaje, visual-lingüística, difusión y robótica al mismo tiempo. Tiene poco atractivo para los usuarios de una sola GPU o para los equipos que solo hacen inferencias; esto es típico de las herramientas a escala de clúster.
-
Han pasado aproximadamente tres meses desde que LoongForge fue oficialmente de código abierto y los comentarios de la comunidad aún se encuentran en las primeras etapas de acumulación. A juzgar por las interacciones en GitHub Issues y blogs de ingeniería, la reacción de la comunidad técnica es en general positiva. Los comentarios positivos se centran en varios aspectos: primero, el posicionamiento de "un marco que cubra todos los modos" llega al punto débil real. Algunos comentarios de usuarios mencionaron que "finalmente no hay necesidad de alternar entre Megatron, LeRobot y los marcos de difusión"; en segundo lugar, los datos de rendimiento son relativamente sólidos y un artículo de análisis independiente del sitio de evaluación externo besthub.dev reconoció su rendimiento de aceleración más de 5 veces en el modelo DSA; En tercer lugar, las ventajas diferenciales del backend de hardware dual son obvias y, a menudo, se consideran LoongForge en los artículos comparativos de la comunidad. La principal diferencia entre Megatron-LM y DeepSpeed es que los dos últimos no tienen soporte nativo en los núcleos Kunlun. Los comentarios negativos y los puntos controvertidos también merecen atención: en primer lugar, el marco aún se encuentra en la etapa inicial (v0.1.0) y algunas funciones (como la estabilidad de la conversión del formato de punto de control) aún se encuentran en iteración continua; en segundo lugar, el umbral de instalación e implementación es alto y actualmente depende de imágenes de Docker o compilación de código fuente, lo que requiere cierta experiencia en configuración de ingeniería; En tercer lugar, el proyecto actualmente solo tiene más de 150 estrellas, lo que está muy por detrás de la madurez de Megatron-LM, y el ecosistema de contribución de la comunidad aún no ha formado una escala. Algunos usuarios también informaron que el documento necesita mejoras adicionales, especialmente que algunos capítulos de la versión china del documento aún tienen rastros de traducción.
-
La pista del marco de entrenamiento de IA donde se encuentra LoongForge ahora ha formado varias capas claras. En el campo de la formación LLM, Megatron-LM de NVIDIA y DeepSpeed de Microsoft son los estándares de facto de la industria. El primero ha sido ampliamente adoptado para la realización de capacitación distribuida a gran escala y el segundo es conocido por su serie de optimización ZeRO. Además de estos dos marcos, también están LLaMA-Factory, Axolotl para ajustar escenarios y el ecosistema Transformers of the Hugging Face. La singularidad de LoongForge es que no es un marco de formación de LLM puro, sino un marco de "agregación" que intenta conectar múltiples modalidades. Hereda la estrategia paralela de Megatron-LM como base de LLM, complementa el desacoplamiento de componentes visuales de VLM y el soporte de modelo incorporado de VLA que generalmente faltan en el marco de LLM y es compatible con versiones anteriores del modelo de difusión. Los medios de la industria 36kr y los informes de auto-medios de múltiples tecnologías generalmente creen que este posicionamiento es "pragmático": no pretende reemplazar a nadie, sino llenar los vacíos en escenarios multimodales como Megatron-LM. Vale la pena señalar que LoongForge ocupa una posición única en el ecosistema de chips nacional. En la actualidad, los principales marcos de capacitación de código abierto generalmente tienen un soporte débil para chips nacionales, y el soporte nativo Kunlun XPU de LoongForge lo hace casi sin competencia directa en escenarios de potencia informática nacional. Esta ventaja puede amplificarse aún más a medida que siga aumentando la proporción de chips nacionales en el entrenamiento de modelos grandes.
-
El principal riesgo de LoongForge en esta etapa proviene de su madurez. La versión v0.1.0 aún es una versión temprana y los problemas de configuración del entorno que encontraron algunos usuarios durante la implementación aún no se han asimilado por completo. En comparación con las miles de estrellas de Megatron-LM en GitHub y la enorme escala de contribuyentes de la comunidad, la ecología comunitaria de LoongForge está lejos de estar madura y el mantenimiento y desarrollo a largo plazo dependen en gran medida de la inversión continua del equipo de Baidu Baige. Si las prioridades estratégicas internas de Baidu cambian, el ritmo de iteración del marco puede verse afectado. A nivel técnico, aunque el subsistema de entrenamiento de modelos incorporados de LoongForge tiene una idea de diseño clara, la madurez del campo de inteligencia incorporado en sí todavía está evolucionando rápidamente y aún no se han formado estándares para los modelos de políticas convencionales, lo que significa que la compatibilidad del marco en la dirección incorporada puede enfrentar la presión de iteraciones continuas. Además, también son cuestiones que merecen atención continua si la profundidad de optimización del marco de Kunlun XPU tiene una dependencia implícita de un hardware específico y si esta optimización puede ser reproducida por un equipo externo a bajo costo sin depender de la potencia informática interna de Baidu.
-
El perfil de equipo para el que LoongForge es más adecuado: aquellos que realizan preentrenamiento de modelos a gran escala o ajustes finos a gran escala, utilizando múltiples modalidades (LLM + VLM o LLM + difusión o combinaciones más complejas), han sentido que el costo de mantener múltiples conjuntos de marcos de capacitación está aumentando y desean conservar la capacidad de cambiar de manera flexible entre dos plataformas de hardware. Para aquellos equipos que solo usan LLM en texto plano para realizar ajustes, puede ser más liviano y eficiente usar directamente LLaMA-Factory o Hugging Face's Trainer. Si un equipo depende únicamente de las GPU de NVIDIA y no requiere entrenamiento de modelo incorporado, la versión actual de Megatron-LM o DeepSpeed sigue siendo una opción más segura.
-
LoongForge es un marco de formación totalmente modal con un posicionamiento claro y un diseño pragmático. Ha aportado un valor diferenciado al reducir la complejidad de los proyectos de capacitación multimodal y abrir el ecosistema de chips nacional. No es un marco que intenta "conquistar el mundo", sino llenar los vacíos en la pila de tecnología existente en escenarios multimodales. Si los equipos ya están sintiendo la presión de los costos de ingeniería en la capacitación multimodal, vale la pena seguir este proyecto. Los comentarios positivos de la comunidad de código abierto y la iteración continua de la versión serán variables clave para determinar si realmente puede convertirse en una solución de nivel industrial.
Reseñas de usuarios
-
kqreqlob—LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。 -
DogeDadWalker—终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。 -
MiningMoleFoster—昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。 -
DomingoGonzález—文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。 -
Stephen_Fisher2—apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。 -
Diana.StewartK—换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。 -
bigrabbit734—粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。 -
StephenSmith_Pro601—DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。 -
VerbanShulga vasil—LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。 -
石飞—CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。 -
Sean.Stewart520399—v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。 -
xLauraPáez_dev—我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。 -
ZLong_889—ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。 -
Betty.EvansSr567—看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。 -
Timothy_WilsonJr—同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。 -
Cole397_r—Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。 -
tinygoose585—项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。 -
SGonzales—如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。 -
GregoryMartin_2020—跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。 -
xJesusGrant_dev—自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。 -
Russell_Robinson369—DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。 -
Jude665—总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。 -
x_7kpq611—有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。 -
StephanieWalker_2023—具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。 -
KimberlyLee—作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。 -
FrankLong—测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。 -
TSmith_88—能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。 -
Alan.Price007—自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。 -
DVasquez_2021—搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。 -
RHughes_7718—虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。