LoongForge

Framework de treinamento omnimodal de código aberto do Baidu Baige: cobre o treinamento de LLM, VLM, modelos de difusão e IA incorporada em um único framework unificado, com suporte nativo a GPUs NVIDIA e XPUs Kunlunxin

Relatório detalhado

  • LoongForge é a estrutura de treinamento totalmente modal de código aberto recentemente oficialmente aberta do Baidu Baige, que evoluiu a partir da pilha interna de aceleração de treinamento AIAK-Training-LLM. Ele usa uma estrutura unificada para cobrir as necessidades de treinamento de quatro modos: modelo de linguagem grande (LLM), modelo de linguagem visual (VLM), modelo de difusão (Difusão) e inteligência incorporada (Emcorporada). Ele atinge aceleração de treinamento ponta a ponta de 15% a 50% em modelos convencionais e oferece suporte nativo às plataformas de hardware duplo NVIDIA GPU e Kunlun XPU. A estrutura passou por validação de produção em larga escala com clientes empresariais nas áreas de educação, visão computacional e inteligência incorporada, com um tamanho máximo de cluster de mais de 5.000 aceleradores e é de código aberto usando o protocolo Apache-2.0.

  • O antecessor do LoongForge é o AIAK-Training-LLM, a estrutura de aceleração de treinamento de longo prazo usada internamente pelo Baidu Baige. Antes de ser oficialmente de código aberto, ele já havia passado por testes de nível de produção entre clientes empresariais em vários setores - treinamento de modelo em cenários educacionais, tarefas multimodais em visão computacional e modelos de inteligência incorporada VLA (Visual-Language-Action) foram todos implementados. Em abril de 2026, Baidu Baige decidiu abri-lo oficialmente e nomeou-o LoongForge, juntando-se à série de código aberto Baige Loong, ecoando o LoongFlow (uma estrutura de pensamento e aprendizagem para agentes especialistas em IA) da mesma série. O nome "LoongForge" vem do tradicional barco-dragão chinês, que significa trabalhar em conjunto para quebrar as ondas. Em julho de 2026, seu repositório GitHub tinha mais de 150 estrelas e mantinha um alto nível de atividade comunitária. O blog de engenharia da equipe atualiza regularmente artigos técnicos aprofundados, cobrindo tópicos como treinamento paralelo heterogêneo, balanceamento de carga DP, aceleração de modelo VLA, etc. O conteúdo é de alta qualidade, indicando que a equipe do projeto continuou investindo em tecnologia.

  • O posicionamento central do LoongForge é claro: uma estrutura, quatro modos. Sua arquitetura é dividida em três camadas - a camada do modelo é responsável pela abstração unificada, a camada do sistema concentra-se na otimização ponta a ponta e a camada de hardware resolve a adaptação entre plataformas. Na camada de modelo, LoongForge construiu uma camada de abstração de modelo em cima do Megatron-LM, decompondo o modelo multimodal em três partes: a camada de codificação perceptual (Encoder), a camada de backbone de geração (Foundation) e a camada de agendamento combinada. Para acessar um novo modelo, você só precisa registrar os componentes correspondentes e, em seguida, concluir a emenda do módulo e a configuração da estratégia paralela por meio de um arquivo de configuração YAML sem reescrever o código subjacente. No teste real, a equipe levou apenas alguns dias para adaptar o novo codificador visual RICE-ViT do LLaVA-OneVision. Comparado com o ciclo de adaptação da solução tradicional de várias semanas, houve uma lacuna significativa. Se você deseja substituir o backbone do idioma Qwen3.5 pelo DeepSeek V3, você só precisa alterar o caminho de referência YAML em uma linha. Não há necessidade de desembolsar todo o armazém. A otimização no nível do sistema é mais intensa. Para a base LLM, LoongForge implementa cálculo CCT e paralelismo de transmissão e orquestra uniformemente o cálculo, comunicação e transmissão de dados do modelo MoE em treinamento de longa sequência. O desempenho de treinamento medido do Qwen3-30B-A3B aumentou 16% sob a duração da sequência de 32K. O paralelismo do pipeline ChunkPipe resolve o gargalo de memória de sequências ultralongas, permitindo que milhões de janelas de contexto sejam executadas em clusters pequenos e médios. Para a arquitetura de atenção esparsa DSA do DeepSeek V3.2, LoongForge realizou fusão e otimização profunda de operadores em todo o link de cálculo de atenção, melhorando o desempenho ponta a ponta em aproximadamente 5 vezes. Do lado da otimização multimodal, o mecanismo de balanceamento de carga DP é particularmente crítico. Quando o paralelismo de dados tradicional encontra dados multimodais com comprimentos extremamente desiguais (cerca de 256 tokens para uma única imagem e mais de 100.000 tokens para um vídeo de 20 minutos), a variação quadrática do comprimento da sequência fará com que a quantidade real de cálculo de cada GPU seja muito diferente, com uma placa rápida e uma placa lenta. LoongForge reorganiza dinamicamente a alocação de amostras antes de cada iteração, reduzindo significativamente a lacuna de carga entre as classificações. Este também é um suporte fundamental para atingir mais de 90% de eficiência de expansão linear em um cluster Kakunlun P800 com mais de 5.000.O paralelismo heterogêneo do modelo resolve o problema de eficiência causado pela diferença de centenas de vezes na escala de parâmetros entre o Vision Transformer e o LLM, permitindo-lhes configurar de forma independente estratégias paralelas ideais. O rendimento medido do Qwen3-VL-30B aumentou 45% em comparação com a solução comunitária na sequência de 32K. O design plug-in da camada de hardware é uma vantagem diferenciada do LoongForge. O lado da GPU se conecta ao Megatron nativamente por meio do PyTorch/CUDA, e o lado do XPU usa o plug-in XPU_Plugin para encapsular as diferenças de interface subjacentes. O mesmo código de treinamento só precisa alterar uma variável de ambiente para alternar perfeitamente entre GPU NVIDIA e Kunlun XPU. Para equipes que precisam fazer treinamento em implantações de hardware, isso significa que não há necessidade de manter dois conjuntos de código e de reescrever a lógica distribuída devido à mudança de hardware. Em termos de experiência do usuário, LoongForge dá continuidade aos hábitos dos usuários Megatron. Os parâmetros básicos de treinamento são compatíveis com Megatron, e os estilos de configuração paralela de pipeline e dados são semelhantes. A configuração

  • LoongForge é de código aberto usando o protocolo Apache-2.0. O código-fonte é gratuito e está disponível. Não há distinção de permissão entre a versão comunitária e a versão empresarial. Como infraestrutura de treinamento, seu caminho de comercialização não é vender diretamente licenças de software, mas atrair mais equipes para usar o LoongForge na plataforma de poder de computação do Baidu Baige, impulsionando a demanda por aluguel de poder de computação e serviços de plataforma de IA do Baidu Smart Cloud. Isto é consistente com o modelo de negócio comum dos anteriores quadros de IA de código aberto - o quadro em si é gratuito e, quanto mais fortes forem as capacidades e quanto maior for o ecossistema, mais forte será a atracção pelos serviços de computação upstream. Graças ao design do XPU_Plugin, os usuários que executam o LoongForge no núcleo Baidu Kunlun não precisam fazer adaptações adicionais e os usuários que usam GPUs NVIDIA não são afetados. Os utilizadores-alvo são relativamente claros: equipas que realizam pré-formação ou afinação em grande escala, especialmente aquelas que foram forçadas a manter quatro pilhas de formação diferentes para linguagem, visual-linguística, difusão e robótica ao mesmo tempo. Ele tem pouco apelo para usuários ou equipes de GPU única que fazem apenas inferências – isso é típico de ferramentas em escala de cluster.

  • Já se passaram cerca de três meses desde que o LoongForge se tornou oficialmente de código aberto, e o feedback da comunidade ainda está nos estágios iniciais de acumulação. A julgar pelas interações no GitHub Issues e em blogs de engenharia, a reação da comunidade técnica é geralmente positiva. Os comentários positivos centram-se em vários aspectos: Primeiro, o posicionamento de “uma estrutura que abrange todos os modos” atinge o verdadeiro ponto problemático. Alguns comentários de usuários mencionaram que "finalmente não há necessidade de alternar entre Megatron, LeRobot e estruturas de difusão"; em segundo lugar, os dados de desempenho são relativamente sólidos e um artigo de análise independente do site de avaliação de terceiros besthub.dev reconheceu seu desempenho de aceleração mais de 5 vezes maior no modelo DSA; terceiro, as vantagens diferenciais do back-end de hardware duplo são óbvias e são frequentemente consideradas LoongForge em artigos de comparação da comunidade. A principal diferença entre Megatron-LM e DeepSpeed ​​é que os dois últimos não têm suporte nativo em núcleos Kunlun. Comentários negativos e pontos controversos também merecem atenção: primeiro, a estrutura ainda está em estágio inicial (v0.1.0) e algumas funções (como a estabilidade da conversão do formato do ponto de verificação) ainda estão em iteração contínua; em segundo lugar, o limite de instalação e implantação é alto e atualmente depende de imagens Docker ou compilação de código-fonte, o que requer certa experiência em configuração de engenharia; terceiro, o projeto tem atualmente apenas mais de 150 estrelas, o que está muito aquém da maturidade do Megatron-LM, e o ecossistema de contribuição da comunidade ainda não formou uma escala. Alguns usuários também relataram que o documento precisa de mais melhorias, especialmente porque alguns capítulos da versão chinesa do documento ainda apresentam vestígios de tradução.

  • A estrutura de treinamento de IA onde o LoongForge está localizado agora formou várias camadas claras. No campo do treinamento LLM, o Megatron-LM da NVIDIA e o DeepSpeed ​​​​da Microsoft são os padrões de fato da indústria. O primeiro tem sido amplamente adotado para a realização de treinamento distribuído em larga escala, e o último é conhecido por sua série de otimização ZeRO. Além desses dois frameworks, há também o LLaMA-Factory, o Axolotl para ajustes finos de cenários e o ecossistema Transformers of the Hugging Face. A singularidade do LoongForge é que ele não é uma estrutura de treinamento LLM pura, mas uma estrutura de “agregação” que tenta conectar múltiplas modalidades. Ele herda a estratégia paralela do Megatron-LM como base do LLM, complementa o desacoplamento do componente visual do VLM e o suporte do modelo incorporado ao VLA que geralmente faltam na estrutura do LLM e é compatível com versões anteriores do modelo de difusão. A mídia da indústria 36kr e os relatórios de mídia própria de múltiplas tecnologias geralmente acreditam que esse posicionamento é "pragmático" - não pretende substituir ninguém, mas preencher as lacunas em cenários multimodais como o Megatron-LM. É importante notar que LoongForge ocupa uma posição única no ecossistema de chips doméstico. Atualmente, as principais estruturas de treinamento de código aberto geralmente têm suporte fraco para chips domésticos, e o suporte nativo Kunlun XPU do LoongForge torna-o quase sem competição direta em cenários de poder de computação doméstico. Esta vantagem pode ser ainda mais ampliada à medida que a proporção de chips domésticos no treinamento de grandes modelos continua a aumentar.

  • O principal risco do LoongForge nesta fase decorre da sua maturidade. A versão v0.1.0 ainda é uma versão inicial e os problemas de configuração do ambiente encontrados por alguns usuários durante a implantação ainda não foram totalmente digeridos. Em comparação com as milhares de estrelas do Megatron-LM no GitHub e a enorme escala de contribuidores da comunidade, a ecologia da comunidade do LoongForge está longe de ser madura e a manutenção e o desenvolvimento a longo prazo são altamente dependentes do investimento contínuo da equipe do Baidu Baige. Se as prioridades estratégicas internas do Baidu mudarem, o ritmo de iteração da estrutura poderá ser afetado. A nível técnico, embora o subsistema de formação de modelos incorporados do LoongForge tenha uma ideia de design clara, a maturidade do próprio campo de inteligência incorporada ainda está a evoluir rapidamente e os padrões para os modelos políticos convencionais ainda não foram formados, o que significa que a compatibilidade do quadro na direcção incorporada pode enfrentar a pressão de iterações contínuas. Além disso, se a profundidade de otimização da estrutura do Kunlun XPU tem uma dependência implícita de hardware específico e se essa otimização pode ser reproduzida por uma equipe externa a baixo custo, sem depender do poder de computação interno do Baidu, também são questões que merecem atenção contínua.

  • O perfil de equipe para o qual LoongForge é mais adequado: aqueles que estão realizando pré-treinamento de modelos em grande escala ou ajuste fino em grande escala, usando múltiplas modalidades (LLM + VLM ou LLM + difusão ou combinações mais complexas), sentiram que o custo de manutenção de vários conjuntos de estruturas de treinamento está aumentando e desejam manter a capacidade de alternar com flexibilidade entre duas plataformas de hardware. Para aquelas equipes que usam apenas LLM de texto simples para ajuste fino, pode ser mais leve e eficiente usar diretamente o LLaMA-Factory ou o Hugging Face’s Trainer. Se uma equipe depende exclusivamente de GPUs NVIDIA e não exige treinamento de modelo incorporado, a versão atual do Megatron-LM ou DeepSpeed ​​​​continua sendo uma escolha mais segura.

  • LoongForge é uma estrutura de treinamento totalmente modal com posicionamento claro e design pragmático. Agregou um valor diferenciado na redução da complexidade dos projetos de treinamento multimodais e na abertura do ecossistema doméstico de chips. Não é uma estrutura que tenta “conquistar o mundo”, mas sim preencher as lacunas na pilha de tecnologia existente em cenários multimodais. Se as equipes já estão sentindo a pressão dos custos de engenharia no treinamento multimodal, vale a pena ficar de olho neste projeto. O feedback positivo da comunidade de código aberto e a iteração contínua da versão serão variáveis-chave para saber se ele pode realmente crescer e se tornar uma solução de nível industrial.

Avaliações de usuários

  • avatar
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • avatar
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • avatar
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • avatar
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • avatar
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • avatar
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • avatar
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • avatar
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • avatar
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • avatar
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • avatar
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • avatar
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • avatar
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • avatar
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • avatar
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • avatar
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • avatar
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • avatar
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • avatar
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • avatar
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • avatar
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • avatar
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • avatar
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • avatar
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • avatar
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • avatar
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • avatar
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • avatar
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • avatar
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • avatar
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。