LoongForge

Framework huấn luyện toàn phương thức mã nguồn mở của Baidu Baige: bao phủ huấn luyện LLM, VLM, mô hình khuếch tán và AI hiện thân trong một framework thống nhất, hỗ trợ native GPU NVIDIA và XPU Kunlunxin

Báo cáo chuyên sâu

  • LoongForge là khung đào tạo đầy đủ phương thức có nguồn mở chính thức gần đây của Baidu Baige, được phát triển từ hệ thống tăng tốc đào tạo nội bộ AIAK-Training-LLM. Nó sử dụng một khuôn khổ thống nhất để đáp ứng nhu cầu đào tạo của bốn chế độ: mô hình ngôn ngữ lớn (LLM), mô hình ngôn ngữ hình ảnh (VLM), mô hình khuếch tán (Diffusion) và trí tuệ thể hiện (Embbed). Nó đạt được khả năng tăng tốc đào tạo từ đầu đến cuối từ 15%–50% trên các mẫu máy phổ thông và hỗ trợ nguyên bản các nền tảng phần cứng kép GPU NVIDIA và Kunlun XPU. Khung này đã trải qua quá trình xác thực sản xuất quy mô lớn với các khách hàng doanh nghiệp trong lĩnh vực giáo dục, thị giác máy tính và trí tuệ nhân tạo, với kích thước cụm tối đa hơn 5.000 máy gia tốc và là nguồn mở sử dụng giao thức Apache-2.0.

  • Tiền thân của LoongForge là AIAK-Training-LLM, khung tăng tốc đào tạo dài hạn được Baidu Baige sử dụng nội bộ. Trước khi có nguồn mở chính thức, nó đã vượt qua các thử nghiệm ở cấp độ sản xuất giữa các khách hàng doanh nghiệp trong nhiều ngành - đào tạo mô hình trong các kịch bản giáo dục, nhiệm vụ đa phương thức trong thị giác máy tính và các mô hình VLA (Visual-Language-Action) thông minh thể hiện đều đã được triển khai. Vào tháng 4 năm 2026, Baidu Baige quyết định chính thức mở mã nguồn và đặt tên là LoongForge, tham gia chuỗi mã nguồn mở Baige Loong, lặp lại LoongFlow (một khung tư duy và học tập dành cho các tác nhân AI chuyên nghiệp) trong cùng một chuỗi. Cái tên "LoongForge" được lấy từ thuyền rồng truyền thống của Trung Quốc, có nghĩa là cùng nhau vượt sóng. Tính đến tháng 7 năm 2026, kho lưu trữ GitHub của nó có hơn 150 sao và duy trì hoạt động cộng đồng ở mức độ cao. Blog kỹ thuật của nhóm thường xuyên cập nhật các bài viết chuyên sâu về kỹ thuật, bao gồm các chủ đề như đào tạo song song không đồng nhất, cân bằng tải DP, tăng tốc mô hình VLA, v.v. Nội dung có chất lượng cao, cho thấy nhóm dự án đã tiếp tục đầu tư vào công nghệ.

  • Định vị cốt lõi của LoongForge rất rõ ràng: một khung, bốn chế độ. Kiến trúc của nó được chia thành ba lớp - lớp mô hình chịu trách nhiệm trừu tượng hóa thống nhất, lớp hệ thống tập trung vào tối ưu hóa từ đầu đến cuối và lớp phần cứng giải quyết việc thích ứng đa nền tảng. Ở lớp mô hình, LoongForge đã xây dựng một lớp trừu tượng mô hình trên Megatron-LM, phân tách mô hình đa phương thức thành ba phần: lớp mã hóa nhận thức (Bộ mã hóa), lớp xương sống thế hệ (Nền tảng) và lớp lập kế hoạch kết hợp. Để truy cập một mô hình mới, bạn chỉ cần đăng ký các thành phần tương ứng, sau đó hoàn thành việc ghép nối mô-đun và cấu hình chiến lược song song thông qua tệp cấu hình YAML mà không cần viết lại mã cơ bản. Trong thử nghiệm thực tế, nhóm chỉ mất vài ngày để điều chỉnh bộ mã hóa hình ảnh mới RICE-ViT của LLaVA-OneVision. So với chu kỳ thích ứng của giải pháp truyền thống kéo dài vài tuần, có một khoảng cách đáng kể. Nếu bạn muốn thay thế xương sống ngôn ngữ của Qwen3.5 bằng DeepSeek V3, bạn chỉ cần thay đổi đường dẫn tham chiếu YAML trong một dòng. Không cần phải phân nhánh toàn bộ kho. Tối ưu hóa ở cấp độ hệ thống chuyên sâu hơn. Đối với cơ sở LLM, LoongForge triển khai tính song song tính toán và truyền CCT, đồng thời điều phối thống nhất việc tính toán, liên lạc và truyền dữ liệu của mô hình MoE trong đào tạo trình tự dài. Hiệu suất huấn luyện Qwen3-30B-A3B đo được đã tăng 16% trong độ dài chuỗi 32K. Tính song song của đường ống ChunkPipe giải quyết tắc nghẽn bộ nhớ của các chuỗi siêu dài, cho phép hàng triệu cửa sổ ngữ cảnh chạy trên các cụm vừa và nhỏ. Đối với kiến ​​trúc chú ý thưa thớt DSA của DeepSeek V3.2, LoongForge đã thực hiện sự kết hợp và tối ưu hóa toán tử sâu trên toàn bộ liên kết tính toán chú ý, cải thiện hiệu suất toàn diện khoảng 5 lần. Về mặt tối ưu hóa đa phương thức, cơ chế cân bằng tải DP đặc biệt quan trọng. Khi song song dữ liệu truyền thống gặp dữ liệu đa phương thức có độ dài cực kỳ không đồng đều (khoảng 256 mã thông báo cho một hình ảnh và hơn 100.000 mã thông báo cho một video dài 20 phút), phương sai bậc hai của độ dài chuỗi sẽ khiến số lượng tính toán thực tế của mỗi GPU rất khác nhau, với thẻ nhanh và thẻ chậm. LoongForge tự động sắp xếp lại việc phân bổ mẫu trước mỗi lần lặp, thu hẹp đáng kể khoảng cách tải giữa các cấp. Đây cũng là yếu tố hỗ trợ chính giúp nó đạt được hiệu suất mở rộng tuyến tính hơn 90% trên cụm Kakunlun P800 trên 5000.Mô hình song song không đồng nhất của mô hình giải quyết vấn đề hiệu quả do chênh lệch hàng trăm lần về thang tham số giữa Vision Transformer và LLM, cho phép chúng định cấu hình độc lập các chiến lược song song tối ưu. Thông lượng đo được của Qwen3-VL-30B tăng 45% so với giải pháp cộng đồng theo trình tự 32K. Thiết kế plug-in của lớp phần cứng là một lợi thế khác biệt của LoongForge. Phía GPU kết nối với Megatron nguyên bản thông qua PyTorch/CUDA và phía XPU sử dụng trình cắm XPU_Plugin để gói gọn những khác biệt về giao diện cơ bản. Mã đào tạo tương tự chỉ cần thay đổi một biến môi trường để chuyển đổi liền mạch giữa GPU NVIDIA và Kunlun XPU. Đối với các nhóm cần đào tạo về triển khai phần cứng, điều này có nghĩa là không cần duy trì hai bộ mã và không cần viết lại logic phân tán do thay đổi phần cứng. Về trải nghiệm người dùng, LoongForge tiếp tục thói quen của người dùng Megatron. Các tham số đào tạo cơ bản tương thích với Megatron, đồng thời các kiểu cấu hình song song đường ống và dữ liệu cũng tương tự nhau. Cấu hình độc lập ở cấp thành phần (chẳng hạn như sử dụng các kích thước TP khác nhau cho bộ mã hóa hình ảnh và xương sống ngôn ngữ) được triển khai thông qua Hydra, điều này không quá khó khăn đối với các nhóm có một số kinh nghiệm về đào tạo phân tán để bắt đầu. Chuỗi công cụ xử lý trước dữ liệu và các công cụ để chuyển đổi ngoại tuyến trọng số HuggingFace cũng được tích hợp sẵn. Phiên bản hiện tại (v0.1.0, phát hành vào tháng 5 năm 2026) hỗ trợ hơn 20 dòng mô hình, bao gồm các LLM chính thống như DeepSeek (V2/V3/V3.2/V4), Qwen (dòng đầy đủ

  • LoongForge là nguồn mở sử dụng giao thức Apache-2.0. Mã nguồn là miễn phí và có sẵn. Không có sự phân biệt quyền giữa phiên bản cộng đồng và phiên bản doanh nghiệp. Là một cơ sở hạ tầng đào tạo, con đường thương mại hóa của nó không phải là bán trực tiếp giấy phép phần mềm mà là thu hút nhiều nhóm hơn sử dụng LoongForge trên nền tảng sức mạnh điện toán của Baidu Baige, thúc đẩy nhu cầu về các dịch vụ nền tảng AI và cho thuê sức mạnh điện toán của Baidu Smart Cloud. Điều này phù hợp với mô hình kinh doanh chung của các khung AI nguồn mở trước đây - bản thân khung này là miễn phí, khả năng và hệ sinh thái càng lớn thì sức hút đối với các dịch vụ điện toán ngược dòng càng mạnh. Nhờ thiết kế của XPU_Plugin, người dùng chạy LoongForge trên lõi Baidu Kunlun không cần thực hiện các điều chỉnh bổ sung và người dùng sử dụng GPU NVIDIA không bị ảnh hưởng. Người dùng mục tiêu tương đối rõ ràng: các nhóm đang thực hiện đào tạo trước hoặc tinh chỉnh trên quy mô lớn, đặc biệt là những nhóm buộc phải duy trì bốn nhóm đào tạo khác nhau về ngôn ngữ, ngôn ngữ hình ảnh, truyền bá và robot cùng một lúc. Nó ít hấp dẫn đối với người dùng GPU đơn hoặc các nhóm chỉ thực hiện suy luận - đây là điển hình của các công cụ quy mô cụm.

  • Đã khoảng ba tháng kể từ khi LoongForge chính thức là nguồn mở và phản hồi của cộng đồng vẫn đang trong giai đoạn tích lũy ban đầu. Đánh giá từ các tương tác trên GitHub Issues và các blog kỹ thuật, phản ứng từ cộng đồng kỹ thuật nhìn chung là tích cực. Các nhận xét tích cực tập trung vào một số khía cạnh: Thứ nhất, việc định vị "một khuôn khổ bao gồm tất cả các chế độ" đã chạm đến điểm yếu thực sự. Một số bình luận của người dùng đề cập rằng "cuối cùng không cần phải chuyển đổi qua lại giữa Megatron, LeRobot và các khung khuếch tán"; thứ hai, dữ liệu hiệu suất tương đối chắc chắn và một bài viết phân tích độc lập của trang đánh giá bên thứ ba besthub.dev đã công nhận hiệu suất tăng tốc hơn 5 lần của nó trên mô hình DSA; thứ ba, những lợi thế khác biệt của phần phụ trợ phần cứng kép là rõ ràng và thường được coi là LoongForge trong các bài viết so sánh của cộng đồng. Sự khác biệt cốt lõi giữa Megatron-LM và DeepSpeed ​​- hai cái sau không có hỗ trợ riêng trên lõi Kunlun. Những nhận xét tiêu cực và điểm gây tranh cãi cũng đáng được chú ý: Thứ nhất, khung vẫn đang ở giai đoạn đầu (v0.1.0) và một số chức năng (chẳng hạn như tính ổn định của chuyển đổi định dạng điểm kiểm tra) vẫn đang được lặp lại liên tục; thứ hai, ngưỡng cài đặt và triển khai cao và hiện tại nó dựa vào hình ảnh Docker hoặc biên dịch mã nguồn, đòi hỏi kinh nghiệm cấu hình kỹ thuật nhất định; thứ ba, dự án hiện chỉ có hơn 150 sao, kém xa so với mức trưởng thành của Megatron-LM và hệ sinh thái đóng góp cộng đồng vẫn chưa hình thành quy mô. Một số người dùng cũng phản ánh rằng tài liệu cần được cải thiện hơn nữa, đặc biệt là một số chương của tài liệu phiên bản tiếng Trung vẫn còn dấu vết dịch thuật.

  • Khung đào tạo AI nơi LoongForge tọa lạc hiện đã hình thành nhiều lớp rõ ràng. Trong lĩnh vực đào tạo LLM, Megatron-LM của NVIDIA và DeepSpeed ​​​​của Microsoft là những tiêu chuẩn ngành trên thực tế. Cái trước đã được áp dụng rộng rãi để thực hiện đào tạo phân tán quy mô lớn và cái sau được biết đến với loạt tối ưu hóa ZeRO. Ngoài 2 framework này còn có LLaMA-Factory, Axolotl để tinh chỉnh các kịch bản và hệ sinh thái Transformers of the Hugging Face. Điểm độc đáo của LoongForge là nó không phải là khung đào tạo LLM thuần túy mà là khung "tổng hợp" nhằm cố gắng kết nối nhiều phương thức. Nó kế thừa chiến lược song song của Megatron-LM làm cơ sở LLM, bổ sung cho tính năng tách thành phần hình ảnh VLM và hỗ trợ mô hình thể hiện VLA thường thiếu trong khung LLM và tương thích ngược với mô hình khuếch tán. Các phương tiện truyền thông trong ngành 36kr và nhiều báo cáo tự truyền thông về công nghệ thường tin rằng định vị này là "thực dụng" - nó không tuyên bố thay thế bất kỳ ai mà để lấp đầy những khoảng trống trong các kịch bản đa phương thức như Megatron-LM. Điều đáng chú ý là LoongForge chiếm một vị trí độc tôn trong hệ sinh thái chip trong nước. Hiện tại, các khung đào tạo nguồn mở chính thống thường có sự hỗ trợ yếu cho chip trong nước và sự hỗ trợ Kunlun XPU gốc của LoongForge khiến nó gần như không có sự cạnh tranh trực tiếp trong các kịch bản sức mạnh tính toán trong nước. Lợi thế này có thể được nhân rộng hơn nữa khi tỷ lệ chip nội địa trong đào tạo mô hình lớn tiếp tục tăng.

  • Rủi ro chính với LoongForge ở giai đoạn này bắt nguồn từ sự trưởng thành của nó. Phiên bản v0.1.0 vẫn là bản phát hành sớm và các vấn đề về cấu hình môi trường mà một số người dùng gặp phải trong quá trình triển khai vẫn chưa được xử lý đầy đủ. So với hàng nghìn ngôi sao của Megatron-LM trên GitHub và quy mô cộng đồng khổng lồ, hệ sinh thái cộng đồng của LoongForge còn lâu mới trưởng thành và việc duy trì và phát triển lâu dài phụ thuộc rất nhiều vào sự đầu tư liên tục của nhóm Baidu Baige. Nếu các ưu tiên chiến lược nội bộ của Baidu thay đổi, nhịp lặp của khung có thể bị ảnh hưởng. Ở cấp độ kỹ thuật, mặc dù hệ thống con đào tạo mô hình thể hiện của LoongForge có ý tưởng thiết kế rõ ràng, nhưng sự trưởng thành của lĩnh vực trí tuệ thể hiện vẫn đang phát triển nhanh chóng và các tiêu chuẩn cho các mô hình chính sách chính thống vẫn chưa được hình thành, điều đó có nghĩa là tính tương thích của khuôn khổ theo hướng thể hiện có thể phải đối mặt với áp lực lặp lại liên tục. Ngoài ra, liệu độ sâu tối ưu hóa của khung Kunlun XPU có phụ thuộc ngầm vào phần cứng cụ thể hay không và liệu sự tối ưu hóa này có thể được tái tạo bởi một nhóm bên ngoài với chi phí thấp mà không cần dựa vào sức mạnh tính toán nội bộ của Baidu hay không, cũng là những vấn đề đáng được quan tâm tiếp tục.

  • Hồ sơ nhóm mà LoongForge phù hợp nhất với: những người đang thực hiện đào tạo trước mô hình quy mô lớn hoặc tinh chỉnh quy mô lớn, sử dụng nhiều phương thức (LLM + VLM hoặc LLM + khuếch tán hoặc các kết hợp phức tạp hơn), cảm thấy rằng chi phí duy trì nhiều bộ khung đào tạo đang tăng lên và muốn duy trì khả năng chuyển đổi linh hoạt giữa hai nền tảng phần cứng. Đối với những nhóm chỉ sử dụng LLM văn bản thuần túy để tinh chỉnh, việc sử dụng trực tiếp LLaMA-Factory hoặc Hugging Face's Trainer có thể nhẹ nhàng và hiệu quả hơn. Nếu một nhóm chỉ dựa vào GPU NVIDIA và không yêu cầu đào tạo mô hình nhúng thì phiên bản hiện tại của Megatron-LM hoặc DeepSpeed ​​vẫn là lựa chọn an toàn hơn.

  • LoongForge là một khung đào tạo đầy đủ phương thức với định vị rõ ràng và thiết kế thực dụng. Nó đã tạo ra giá trị khác biệt trong việc giảm độ phức tạp của các dự án đào tạo đa phương thức và mở ra hệ sinh thái chip trong nước. Nó không phải là một khuôn khổ cố gắng "chinh phục thế giới", mà là lấp đầy những khoảng trống trong kho công nghệ hiện có trong các kịch bản đa phương thức. Nếu các nhóm đang cảm thấy áp lực về chi phí kỹ thuật trong đào tạo đa phương thức, thì dự án này đáng để mắt tới. Phản hồi tích cực từ cộng đồng nguồn mở và việc lặp lại phiên bản liên tục sẽ là những biến số quan trọng trong việc liệu nó có thể thực sự phát triển thành một giải pháp cấp công nghiệp hay không.

Đánh giá của người dùng

  • ảnh đại diện
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • ảnh đại diện
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • ảnh đại diện
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • ảnh đại diện
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • ảnh đại diện
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • ảnh đại diện
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • ảnh đại diện
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • ảnh đại diện
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • ảnh đại diện
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • ảnh đại diện
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • ảnh đại diện
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • ảnh đại diện
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • ảnh đại diện
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • ảnh đại diện
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • ảnh đại diện
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • ảnh đại diện
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • ảnh đại diện
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • ảnh đại diện
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • ảnh đại diện
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • ảnh đại diện
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • ảnh đại diện
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • ảnh đại diện
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • ảnh đại diện
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • ảnh đại diện
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • ảnh đại diện
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • ảnh đại diện
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • ảnh đại diện
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • ảnh đại diện
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • ảnh đại diện
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • ảnh đại diện
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。