LoongForge

바이두 바이거(Baige)가 오픈소스로 공개한 전 모달리티 학습 프레임워크. LLM, VLM, 확산 모델, 임바디드 AI 학습을 하나의 통합 프레임워크로 지원하며 NVIDIA GPU와 쿤룬신 XPU를 네이티브 지원

심층 리포트

  • LoongForge는 Baidu Baige가 최근 공식적으로 오픈 소스로 공개한 전체 모드 훈련 프레임워크로, 내부 훈련 가속 스택 AIAK-Training-LLM에서 발전했습니다. 이는 통합 프레임워크를 사용하여 LLM(대형 언어 모델), VLM(시각 언어 모델), 확산 모델(Diffusion) 및 구체화된 지능(Embodied)의 네 가지 모드의 교육 요구 사항을 충족합니다. 메인스트림 모델에서 15%~50%의 엔드투엔드 훈련 가속을 달성하고 기본적으로 NVIDIA GPU 및 Kunlun XPU 듀얼 하드웨어 플랫폼을 지원합니다. 프레임워크는 최대 5,000개 이상의 가속기 클러스터 크기를 통해 교육, 컴퓨터 비전 및 구현 지능 분야의 기업 고객을 대상으로 대규모 생산 검증을 경험했으며 Apache-2.0 프로토콜을 사용하는 오픈 소스입니다.

  • LoongForge의 전신은 Baidu Baige가 내부적으로 사용하는 장기 훈련 가속화 프레임워크인 AIAK-Training-LLM입니다. 공식적으로 오픈 소스로 공개되기 전에는 이미 여러 업계의 기업 고객들 사이에서 생산 수준 테스트를 거쳤습니다. 교육 시나리오의 모델 훈련, 컴퓨터 비전의 다중 모달 작업, 구현된 지능 VLA(Visual-Language-Action) 모델이 모두 구현되었습니다. 2026년 4월, Baidu Baige는 공식적으로 오픈 소스를 결정하고 LoongForge라는 이름을 지정하여 Baige Loong 오픈 소스 시리즈에 합류했습니다. 이는 동일한 시리즈의 LoongFlow(전문 AI 에이전트를 위한 사고 및 학습 프레임워크)를 반영합니다. "LoongForge"라는 이름은 중국 전통 용선에서 따왔는데, 이는 함께 힘을 모아 파도를 부수는 것을 의미합니다. 2026년 7월 현재 GitHub 저장소에는 150개 이상의 별이 있으며 높은 수준의 커뮤니티 활동을 유지하고 있습니다. 팀의 엔지니어링 블로그에서는 이기종 병렬 훈련, DP 로드 밸런싱, VLA 모델 가속 등과 같은 주제를 다루는 심층 기술 기사를 정기적으로 업데이트합니다. 콘텐츠의 품질이 높아 프로젝트 팀이 계속해서 기술에 투자하고 있음을 알 수 있습니다.

  • LoongForge의 핵심 포지셔닝은 명확합니다. 하나의 프레임워크, 4개의 모드입니다. 아키텍처는 세 가지 계층으로 나뉩니다. 모델 계층은 통합 추상화를 담당하고, 시스템 계층은 엔드투엔드 최적화에 중점을 두고 있으며, 하드웨어 계층은 플랫폼 간 적응을 해결합니다. 모델 계층에서 LoongForge는 Megatron-LM 위에 모델 추상화 계층을 구축하여 다중 모드 모델을 지각 인코딩 계층(Encoder), 생성 백본 계층(Foundation) 및 결합된 스케줄링 계층의 세 부분으로 분해했습니다. 새 모델에 액세스하려면 해당 구성 요소를 등록한 다음 기본 코드를 다시 작성하지 않고 YAML 구성 파일을 통해 모듈 접합 및 병렬 전략 구성을 완료하기만 하면 됩니다. 실제 테스트에서는 팀이 LLaVA-OneVision의 새로운 시각적 인코더 RICE-ViT를 적용하는 데 며칠 밖에 걸리지 않았습니다. 기존 솔루션의 적응 주기가 몇 주였던 것과 비교하면 상당한 격차가 있었습니다. Qwen3.5의 언어 백본을 DeepSeek V3으로 교체하려면 한 줄에서 YAML 참조 경로만 변경하면 됩니다. 전체 창고를 분기할 필요가 없습니다. 시스템 수준의 최적화는 더욱 집중적입니다. LLM 기반의 경우 LoongForge는 CCT 계산 및 전송 병렬성을 구현하고 긴 시퀀스 훈련에서 MoE 모델의 계산, 통신 및 데이터 전송을 균일하게 조정합니다. 측정된 Qwen3-30B-A3B 훈련 성능은 32K 시퀀스 길이에서 16% 증가했습니다. ChunkPipe 파이프라인 병렬 처리는 매우 긴 시퀀스의 메모리 병목 현상을 해결하여 수백만 개의 컨텍스트 창이 중소 규모 클러스터에서 실행될 수 있도록 합니다. DeepSeek V3.2의 DSA Sparse Attention 아키텍처를 위해 LoongForge는 전체 Attention 계산 링크에 대해 심층 연산자 융합 및 최적화를 수행하여 엔드투엔드 성능을 약 5배 향상시켰습니다. 다중 모드 최적화 측면에서는 DP 로드 밸런싱 메커니즘이 특히 중요합니다. 전통적인 데이터 병렬 처리가 길이가 매우 균일하지 않은 다중 모드 데이터(단일 사진의 경우 약 256개 토큰, 20분 비디오의 경우 100,000개 이상의 토큰)를 접할 경우 시퀀스 길이의 2차 변화로 인해 각 GPU의 실제 계산량이 빠른 카드와 느린 카드로 매우 달라집니다. LoongForge는 각 반복 전에 샘플 할당을 동적으로 재정렬하여 순위 간의 로드 격차를 크게 줄입니다. 이는 또한 5000개 이상의 Kakunlun P800 클러스터에서 90% 이상의 선형 확장 효율성을 달성하기 위한 핵심 지원입니다.모델 이종 병렬화는 Vision Transformer와 LLM 간의 수백 배에 달하는 매개변수 규모 차이로 인해 발생하는 효율성 문제를 해결하여 최적의 병렬 전략을 독립적으로 구성할 수 있도록 합니다. Qwen3-VL-30B의 측정된 처리량은 32K 시퀀스에서 커뮤니티 솔루션에 비해 45% 증가했습니다. 하드웨어 레이어의 플러그인 디자인은 룽포지의 차별화된 장점이다. GPU 측은 기본적으로 PyTorch/CUDA를 통해 Megatron에 연결되고, XPU 측은 XPU_Plugin 플러그인을 사용하여 기본 인터페이스 차이점을 캡슐화합니다. 동일한 훈련 코드는 NVIDIA GPU와 Kunlun XPU 사이를 원활하게 전환하기 위해 하나의 환경 변수만 변경하면 됩니다. 하드웨어 배포 전반에 걸쳐 교육을 수행해야 하는 팀의 경우 이는 두 개의 코드 세트를 유지할 필요가 없으며 하드웨어 변경으로 인해 분산 논리를 다시 작성할 필요가 없음을 의미합니다. 사용자 경험 측면에서 LoongForge는 Megatron 사용자의 습관을 이어갑니다. 기본 훈련 매개변수는 Megatron과 호환되며 파이프라인 및 데이터 병렬 구성 스타일은 유사합니다. 구성 요소 수준 독립적 구성(예: 시각적 인코더 및 언어 백본에 대해 서로 다른 TP 크기 사용)은 Hydra를 통해 구현됩니다. 이는 분산 교육 경험이 있는 팀이 시작하는 데 그리 어렵지 않습니다. HuggingFace 가중치의 오프라인 변환을 위한 데이터 전처리 도구 체인 및 도구도 내장되어 있습니다. 현재 버전(v0.1.0, 2026년 5월 출시)은 DeepSeek(V2/V3/V3.2/V4), Qwen(전체 시리즈 0.6B–480B), LLaMA(2/3/3.1), MiniMax, GLM과 같은 주류 LLM을 포괄하는 20개 이상의 모델 제품군을 지원합니다. VLM 측에서는 Qwen2.5/3-VL, InternVL2.5/3.5, Kimi-K2.5/K2.6, ERNIE4.5-VL 등을 지원합니다. 확산 모델은 Wan2.1/2.2 및 Qwen-Image를 지원합니다. 구현된 모델은 Pi0.5, GR00T N1.6/N1.7, X-VLA, FastWAM 및 다양한 월드 액션 모델을 포괄합니다. 이 모델 적용 범위는 현재 오픈 소스 교육 프레임워크 중에서 가장 광범위한 것 중 하나입니다.

  • LoongForge는 Apache-2.0 프로토콜을 사용하는 오픈 소스입니다. 소스 코드는 무료이며 사용 가능합니다. 커뮤니티 버전과 엔터프라이즈 버전 간에는 권한 차이가 없습니다. 교육 인프라로서 상용화 경로는 소프트웨어 라이선스를 직접 판매하는 것이 아니라 Baidu Baige의 컴퓨팅 파워 플랫폼에서 LoongForge를 사용하도록 더 많은 팀을 유치하여 Baidu Smart Cloud의 컴퓨팅 파워 임대 및 AI 플랫폼 서비스에 대한 수요를 촉진하는 것입니다. 이는 이전 오픈 소스 AI 프레임워크의 일반적인 비즈니스 모델과 일치합니다. 즉, 프레임워크 자체는 무료이며, 기능이 강력하고 생태계가 클수록 업스트림 컴퓨팅 서비스에 대한 매력이 더 강해집니다. XPU_Plugin 설계 덕분에 Baidu Kunlun 코어에서 LoongForge를 실행하는 사용자는 추가 적응을 할 필요가 없으며 NVIDIA GPU를 사용하는 사용자는 영향을 받지 않습니다. 대상 사용자는 상대적으로 명확합니다. 사전 훈련 또는 대규모 미세 조정을 수행하는 팀, 특히 언어, 시각 언어, 확산 및 로봇 공학에 대한 네 가지 다른 훈련 스택을 동시에 유지해야 하는 팀입니다. 단일 GPU 사용자나 추론만 수행하는 팀에게는 별 매력이 없습니다. 이는 클러스터 규모 도구의 일반적인 특징입니다.

  • LoongForge가 공식적으로 오픈소스로 출시된 지 약 3개월이 지났고, 커뮤니티 피드백은 아직 축적 초기 단계에 있습니다. GitHub 문제 및 엔지니어링 블로그의 상호 작용을 보면 기술 커뮤니티의 반응은 일반적으로 긍정적입니다. 긍정적인 의견은 여러 측면에 초점을 맞추고 있습니다. 첫째, "모든 모드를 포괄하는 하나의 프레임워크"의 포지셔닝이 실제 문제점에 부딪힙니다. 일부 사용자 의견에서는 "마침내 Megatron, LeRobot 및 확산 프레임워크 간에 전환할 필요가 없습니다"라고 언급했습니다. 둘째, 성능 데이터가 비교적 견고하며, 타사 평가 사이트 besthub.dev의 독립적인 분석 기사에서 DSA 모델에서 5배 이상의 가속 성능을 인정했습니다. 셋째, 듀얼 하드웨어 백엔드의 차별화된 장점은 명백하며 커뮤니티 비교 기사에서 종종 LoongForge로 간주됩니다. Megatron-LM과 DeepSpeed의 핵심 차이점은 후자 두 개는 Kunlun 코어를 기본적으로 지원하지 않는다는 것입니다. 부정적인 의견과 논란의 여지가 있는 점도 주목할 만하다. 첫째, 프레임워크는 아직 초기 단계(v0.1.0)이고 일부 기능(체크포인트 형식 변환의 안정성 등)은 여전히 ​​계속 반복되고 있다. 둘째, 설치 및 배포 임계값이 높으며 현재 특정 엔지니어링 구성 경험이 필요한 Docker 이미지 또는 소스 코드 컴파일에 의존합니다. 셋째, 현재 이 프로젝트에는 스타가 150개가 넘는데, 이는 Megatron-LM의 성숙도에 한참 뒤떨어져 있으며 커뮤니티 기여 생태계가 아직 규모를 형성하지 못했다는 점입니다. 일부 사용자는 또한 문서에 추가 개선이 필요하다고 보고했으며, 특히 중국어 버전 문서의 일부 장에는 여전히 번역 흔적이 남아 있다고 보고했습니다.

  • LoongForge가 위치한 AI 훈련 프레임워크 트랙은 이제 여러 개의 명확한 레이어를 형성했습니다. LLM 교육 분야에서는 NVIDIA의 Megatron-LM과 Microsoft의 DeepSpeed가 사실상 업계 표준입니다. 전자는 대규모 분산 훈련의 성능을 위해 널리 채택되었으며 후자는 ZeRO 최적화 시리즈로 유명합니다. 이 두 가지 프레임워크 외에도 미세 조정 시나리오를 위한 LLaMA-Factory, Axolotl 및 Hugging Face 생태계의 Transformers도 있습니다. LoongForge의 독창성은 순수한 LLM 교육 프레임워크가 아니라 여러 양식을 연결하려고 시도하는 "집합" 프레임워크라는 것입니다. Megatron-LM의 병렬 전략을 LLM 기반으로 계승하고, 일반적으로 LLM 프레임워크에서 누락된 VLM 시각적 구성요소 분리 및 VLA 구현 모델 지원을 보완하며, 확산 모델과 역호환됩니다. 업계 미디어 36kr 및 여러 기술 자체 미디어 보고서는 일반적으로 이러한 포지셔닝이 "실용적"이라고 믿습니다. 이는 누군가를 대체한다고 주장하지 않지만 Megatron-LM과 같은 다중 모드 시나리오의 격차를 메우기 위한 것입니다. LoongForge가 국내 칩 생태계에서 독보적인 위치를 차지하고 있다는 점은 주목할 만합니다. 현재 주류 오픈 소스 교육 프레임워크는 일반적으로 국내 칩에 대한 지원이 약하며 LoongForge의 기본 Kunlun XPU 지원을 통해 국내 컴퓨팅 성능 시나리오에서 직접적인 경쟁이 거의 없습니다. 대형 모델 훈련에 국산 칩이 차지하는 비중이 계속해서 늘어나는 만큼 이러한 장점은 더욱 증폭될 수도 있다.

  • 이 단계에서 LoongForge의 주요 위험은 성숙도에서 비롯됩니다. v0.1.0 버전은 아직 초기 릴리스이며 배포 중에 일부 사용자가 직면한 환경 구성 문제가 아직 완전히 소화되지 않았습니다. Megatron-LM의 GitHub에 있는 수천 개의 스타와 엄청난 규모의 커뮤니티 기여자와 비교할 때 LoongForge의 커뮤니티 생태계는 아직 성숙되지 않았으며 장기적인 유지 관리 및 개발은 Baidu Baige 팀의 지속적인 투자에 크게 의존하고 있습니다. Baidu의 내부 전략적 우선순위가 변경되면 프레임워크의 반복 리듬이 영향을 받을 수 있습니다. 기술 수준에서 LoongForge의 구체화된 모델 훈련 하위 시스템은 명확한 설계 아이디어를 가지고 있지만 구체화된 지능 분야 자체의 성숙도는 여전히 빠르게 발전하고 있으며 주류 정책 모델에 대한 표준은 아직 형성되지 않았습니다. 이는 구체화된 방향에서 프레임워크의 호환성이 지속적인 반복의 압력에 직면할 수 있음을 의미합니다. 또한 Kunlun XPU의 프레임워크 최적화 깊이가 특정 하드웨어에 암묵적으로 의존하는지 여부, 그리고 이 최적화가 Baidu의 내부 컴퓨팅 성능에 의존하지 않고 외부 팀에 의해 저렴한 비용으로 재현될 수 있는지 여부도 계속해서 주목할 만한 문제입니다.

  • LoongForge가 가장 적합한 팀 프로필: 다양한 양식(LLM + VLM 또는 LLM + 확산 또는 더 복잡한 조합)을 사용하여 대규모 모델 사전 훈련 또는 대규모 미세 조정을 수행하는 사람들, 여러 훈련 프레임워크 세트를 유지하는 데 드는 비용이 상승하고 있다고 느꼈고 두 하드웨어 플랫폼 간에 유연하게 전환할 수 있는 기능을 유지하려는 사람들입니다. 미세 조정을 위해 일반 텍스트 LLM만 사용하는 팀의 경우 LLaMA-Factory 또는 Hugging Face의 Trainer를 직접 사용하는 것이 더 가볍고 효율적일 수 있습니다. 팀이 NVIDIA GPU에만 의존하고 구현된 모델 교육이 필요하지 않은 경우 현재 버전의 Megatron-LM 또는 DeepSpeed가 더 안전한 선택으로 남아 있습니다.

  • LoongForge는 명확한 포지셔닝과 실용적인 디자인을 갖춘 전체 모드 교육 프레임워크입니다. 다중 모드 교육 프로젝트의 복잡성을 줄이고 국내 칩 생태계를 개방하는 데 있어 차별화된 가치를 만들어냈습니다. 이는 "세계를 정복"하려는 프레임워크가 아니라 다중 모드 시나리오에서 기존 기술 스택의 격차를 메우려는 프레임워크입니다. 팀이 이미 다중 모드 교육에서 엔지니어링 비용에 대한 압박을 느끼고 있다면 이 프로젝트는 주목할 가치가 있습니다. 오픈소스 커뮤니티의 긍정적인 피드백과 지속적인 버전 반복은 이것이 실제로 산업 수준의 솔루션으로 성장할 수 있는지 여부를 결정하는 핵심 변수가 될 것입니다.

사용자 리뷰

  • 아바타
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • 아바타
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • 아바타
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • 아바타
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • 아바타
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • 아바타
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • 아바타
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • 아바타
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • 아바타
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • 아바타
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • 아바타
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • 아바타
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • 아바타
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • 아바타
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • 아바타
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • 아바타
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • 아바타
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • 아바타
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • 아바타
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • 아바타
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • 아바타
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • 아바타
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • 아바타
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • 아바타
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • 아바타
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • 아바타
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • 아바타
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • 아바타
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • 아바타
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • 아바타
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。