LoongForge
百度百舸开源的全模态训练框架,用一套统一框架覆盖 LLM、VLM、扩散模型和具身智能训练,原生支持 NVIDIA GPU 和昆仑芯 XPU
深度报告
-
LoongForge 是百度百舸近期正式开源的全模态训练框架,由内部训练加速栈 AIAK-Training-LLM 演进而来。它用一个统一框架覆盖大语言模型(LLM)、视觉语言模型(VLM)、扩散模型(Diffusion)和具身智能(Embodied)四种模态的训练需求,在主流模型上实现 15%–50% 的端到端训练加速,并原生支持 NVIDIA GPU 和昆仑芯 XPU 双硬件平台。该框架已在教育、计算机视觉和具身智能领域的企业客户中经历过大规模生产验证,最大集群规模超过 5000 个加速器,采用 Apache-2.0 协议开源。
-
LoongForge 的前身是百度百舸内部长期使用的训练加速框架 AIAK-Training-LLM,在正式开源之前已经在多个行业的企业客户中经受住生产级考验——教育场景的模型训练、计算机视觉的多模态任务、具身智能的 VLA(视觉-语言-动作)模型,均有实际落地。2026 年 4 月,百度百舸决定将其正式开源并命名为 LoongForge,加入百舸 Loong 开源系列,与同系列的 LoongFlow(面向专家级 AI Agent 的思考与学习框架)遥相呼应。 「LoongForge」的名字取自中国传统龙舟,寓意协同发力、破浪前行。截至 2026 年 7 月,其 GitHub 仓库已有超过 150 颗星标,并保持了较高的社区活跃度。团队的工程博客定期更新技术深度文章,涵盖异构并行训练、DP 负载均衡、VLA 模型加速等主题,内容质量较高,说明项目团队对技术投入较为持续。
-
LoongForge 的核心定位很明确:一个框架,四种模态。它的架构分三层——模型层负责统一抽象,系统层专注端到端优化,硬件层解决跨平台适配。 在模型层,LoongForge 在 Megatron-LM 之上构建了一层模型抽象,将多模态模型拆解为感知编码层(Encoder)、生成主干层(Foundation)和组合调度层三部分。接入新模型只需要注册对应组件,然后通过一份 YAML 配置文件完成模块拼接和并行策略配置,不用改写底层代码。实际测试中,团队适配 LLaVA-OneVision 的新视觉编码器 RICE-ViT 只花了几天的工夫,对比传统方案数周的适配周期,差距明显。如果想把 Qwen3.5 的语言主干替换成 DeepSeek V3,改一行 YAML 引用路径就行,不需要 fork 整个仓库。 在系统层的优化则更为密集。针对 LLM 基座,LoongForge 实现了 CCT 算通传并行,将 MoE 模型在长序列训练中的计算、通信和数据传输进行统一编排,实测 Qwen3-30B-A3B 在 32K 序列长度下训练性能提升了 16%。ChunkPipe 流水线并行解决了超长序列显存瓶颈,让百万级上下文窗口在中小规模集群上也能跑。对 DeepSeek V3.2 的 DSA 稀疏注意力架构,LoongForge 对注意力计算全链路做了深度算子融合与优化,端到端性能提升了约 5 倍。 在多模态优化侧,DP 负载均衡机制尤为关键。传统数据并行在遇到长度极不均匀的多模态数据(单张图片约 256 token、20 分钟视频超过 10 万 token)时,序列长度二次方差会导致各 GPU 实际计算量相差悬殊,快的卡等慢的卡。LoongForge 在每轮迭代前对样本分配做动态重排,显著收窄了各 Rank 之间的负载差距,这也是它在 5000+ 卡昆仑 P800 集群上实现 90%+ 线性扩展效率的关键支撑。 模型异构并行则解决了 Vision Transformer 与 LLM 参数规模相差数百倍带来的效率问题,允许二者各自独立配置最优并行策略。实测 Qwen3-VL-30B 在 32K 序列下,相比社区方案吞吐提升了 45%。 硬件层的插件化设计是 LoongForge 的一个差异化优势。GPU 侧通过 PyTorch/CUDA 原生对接 Megatron,XPU 侧通过 XPU_Plugin 插件封装底层接口差异。同一份训练代码只改一个环境变量,就能在 NVIDIA GPU 和昆仑芯 XPU 之间无缝切换。对需要跨硬件部署做训练的团队来说,这意味着不用维护两套代码,也不用因为换硬件而重写分布式逻辑。 使用体验方面,LoongForge 延续了 Megatron 用户的习惯,基础训练参数与 Megatron 兼容,流水线和数据并行的配置风格接近。组件级的独立配置(如视觉编码器和语言主干使用不同的 TP 大小)通过 Hydra 实现,对有一定分布式训练经验的团队来说上手应该不会太困难。数据预处理工具链和离线转换 HuggingFace 权重的工具也已内置。 当前版本(v0.1.0,2026 年 5 月发布)已支持 20+ 模型族,覆盖 DeepSeek(V2/V3/V3.2/V4)、Qwen(全系列 0.6B–480B)、LLaMA(2/3/3.1)、MiniMax、GLM 等主流 LLM;VLM 侧支持 Qwen2.5/3-VL、InternVL2.5/3.5、Kimi-K2.5/K2.6、ERNIE4.5-VL 等;扩散模型支持 Wan2.1/2.2 和 Qwen-Image;具身模型覆盖 Pi0.5、GR00T N1.6/N1.7、X-VLA、FastWAM 和多个世界动作模型。这一模型覆盖范围在开源训练框架中目前是最广的之一。
-
LoongForge 采用 Apache-2.0 协议开源,源代码免费可用,没有社区版与企业版的权限区隔。作为一种训练基础设施,它的商业化路径并非直接售卖软件许可,而是通过吸引更多团队在百度百舸的算力平台上使用 LoongForge,拉动百度智能云的算力租赁和 AI 平台服务需求。这与此前开源 AI 框架常见的商业模式一致——框架本身免费,能力越强、生态越大,对上游算力服务的拉动力就越强。得益于 XPU_Plugin 的设计,在百度昆仑芯上跑 LoongForge 的用户无需额外适配,用 NVIDIA GPU 的用户也不受影响。 目标用户指向比较明确:做预训练或大规模微调的团队,尤其是那些已经被迫同时维护语言、视觉-语言、扩散和机器人四套不同训练栈的团队。它对单 GPU 用户或只做推理的团队没什么吸引力——这是典型的集群级工具。
-
LoongForge 正式开源至今约三个月,社区反馈仍处于早期积累阶段。从 GitHub Issues 和工程博客的互动来看,技术社区的反应总体偏正面。 正面评价集中在几个方面:一是「一套框架覆盖全模态」的定位切中了实际痛点,有用户评论提到「终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了」;二是性能数据比较扎实,第三方评测站点 besthub.dev 的独立分析文章认可了其 DSA 模型上超过 5 倍的加速表现;三是双硬件后端的差异化优势明显,在社区对比文章中常被视作 LoongForge 相较于 Megatron-LM 和 DeepSpeed 的核心差异点——后两者在昆仑芯上均无原生支持。 负面评价和争议点也值得关注:一是框架尚处于早期阶段(v0.1.0),部分功能(如检查点格式转换的稳定性)仍在持续迭代中;二是安装部署门槛较高,目前依赖 Docker 镜像或源码编译,需要一定工程配置经验;三是项目目前只有 150 余颗星标,与 Megatron-LM 的成熟度差距较大,社区贡献生态尚未形成规模。部分用户也反映文档还需要进一步完善,特别是中文版文档的部分章节仍有翻译痕迹。
-
LoongForge 所处的 AI 训练框架赛道,目前已形成几个清晰的分层。在 LLM 训练领域,NVIDIA 的 Megatron-LM 和微软的 DeepSpeed 是事实上的行业标准,前者在大规模分布式训练的性能上一直被广泛采用,后者以 ZeRO 优化系列著称。在这两个框架之外,还有面向微调场景的 LLaMA-Factory、Axolotl,以及 Hugging Face 生态的 Transformers。 LoongForge 的独特之处在于它不是一个纯粹的 LLM 训练框架,而是一个试图拉通多模态的「聚合型」框架。它继承 Megatron-LM 的并行策略作为 LLM 基座,补上 LLM 框架普遍缺失的 VLM 视觉组件解耦和 VLA 具身模型支持,再向下兼容扩散模型。行业媒体 36kr 和多家科技自媒体的报道普遍认为这个定位「务实」——它没有宣称要取代谁,而是去填补 Megatron-LM 等框架在多模态场景下的缺口。 值得注意的是,LoongForge 在国产芯片生态中占据了一个独特位置。目前主流开源训练框架对国产芯片的支持普遍薄弱,而 LoongForge 的原生昆仑芯 XPU 支持使它在国产算力场景下几乎没有直接竞品。这一优势随着国产芯片在大模型训练中的占比持续提升,价值可能会进一步放大。
-
LoongForge 现阶段的主要风险源于它的成熟度。v0.1.0 版本仍属于早期发布,部分用户在部署中遇到的环境配置问题尚未完全消化。与 Megatron-LM 在 GitHub 上数千颗星标和庞大的社区贡献者规模相比,LoongForge 的社区生态还远不够成熟,长期维护和发展高度依赖百度百舸团队的持续投入。如果百度内部战略优先级发生变化,框架的迭代节奏可能受到影响。 技术层面,LoongForge 的具身模型训练子系统虽然设计思路清晰,但具身智能领域自身的成熟度仍在快速演进中,主流策略模型的标准尚未形成,这意味着框架在具身方向的兼容性可能面临持续迭代的压力。此外,框架对昆仑芯 XPU 的优化深度是否存在对特定硬件的隐性依赖,以及这种优化能否在不依赖百度内部算力的情况下被外部团队低成本复现,也是值得持续关注的问题。
-
LoongForge 最适合的团队画像:正在做大模型预训练或大规模微调、使用多种模态(LLM + VLM 或 LLM + 扩散或更复杂的组合)、已经感到维护多套训练框架的成本在上升、并且希望保留在两个硬件平台间灵活切换的能力。对于那些只用纯文本 LLM 做微调的团队,直接用 LLaMA-Factory 或 Hugging Face 的 Trainer 可能更加轻量高效。如果团队完全依赖 NVIDIA GPU 并且不需要具身模型训练,当前版本的 Megatron-LM 或 DeepSpeed 也依然是更稳妥的选择。
-
LoongForge 是一个定位清晰、设计务实的全模态训练框架,在降低多模态训练工程复杂度、打通国产芯片生态方面做出了差异化价值。它不是一个试图「包打天下」的框架,而是去填补已有技术栈在多模态场景下的缺口。如果团队已经在多模态训练中感受到工程成本的压力,值得关注这个项目。开源社区的积极反馈和持续的版本迭代,将是它能否真正成长为产业级解决方案的关键变量。
用户评论
-
kqreqlob—LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。 -
DogeDadWalker—终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。 -
MiningMoleFoster—昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。 -
DomingoGonzález—文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。 -
Stephen_Fisher2—apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。 -
Diana.StewartK—换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。 -
bigrabbit734—粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。 -
StephenSmith_Pro601—DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。 -
VerbanShulga vasil—LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。 -
石飞—CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。 -
Sean.Stewart520399—v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。 -
xLauraPáez_dev—我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。 -
ZLong_889—ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。 -
Betty.EvansSr567—看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。 -
Timothy_WilsonJr—同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。 -
Cole397_r—Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。 -
tinygoose585—项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。 -
SGonzales—如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。 -
GregoryMartin_2020—跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。 -
xJesusGrant_dev—自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。 -
Russell_Robinson369—DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。 -
Jude665—总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。 -
x_7kpq611—有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。 -
StephanieWalker_2023—具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。 -
KimberlyLee—作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。 -
FrankLong—测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。 -
TSmith_88—能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。 -
Alan.Price007—自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。 -
DVasquez_2021—搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。 -
RHughes_7718—虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。