LoongForge

Von Baidu Baige quelloffenes omnimodales Trainingsframework: deckt LLM-, VLM-, Diffusionsmodell- und Embodied-AI-Training in einem einheitlichen Framework ab, mit nativer Unterstützung für NVIDIA-GPUs und Kunlunxin-XPUs

Ausführlicher Bericht

  • LoongForge ist Baidu Baiges kürzlich offiziell offengelegtes vollmodales Trainingsframework, das aus dem internen Trainingsbeschleunigungsstapel AIAK-Training-LLM hervorgegangen ist. Es verwendet ein einheitliches Framework, um den Trainingsbedarf von vier Modi abzudecken: großes Sprachmodell (LLM), visuelles Sprachmodell (VLM), Diffusionsmodell (Diffusion) und verkörperte Intelligenz (Embodied). Es erreicht eine End-to-End-Trainingsbeschleunigung von 15–50 % bei Mainstream-Modellen und unterstützt nativ die Dual-Hardwareplattformen NVIDIA GPU und Kunlun XPU. Das Framework hat eine groß angelegte Produktionsvalidierung bei Unternehmenskunden in den Bereichen Bildung, Computer Vision und verkörperte Intelligenz mit einer maximalen Clustergröße von mehr als 5.000 Beschleunigern erfahren und ist Open Source unter Verwendung des Apache-2.0-Protokolls.

  • Der Vorgänger von LoongForge ist AIAK-Training-LLM, das von Baidu Baige intern verwendete Framework zur Beschleunigung des Langzeittrainings. Bevor es offiziell als Open Source verfügbar war, hatte es bereits Tests auf Produktionsebene bei Unternehmenskunden in mehreren Branchen bestanden – Modelltraining in Bildungsszenarien, multimodale Aufgaben in Computer Vision und verkörperte Intelligenz-VLA-Modelle (Visual-Language-Action) wurden alle implementiert. Im April 2026 beschloss Baidu Baige, es offiziell als Open Source zu veröffentlichen und nannte es LoongForge. Damit reiht es sich in die Open-Source-Reihe Baige Loong ein und lehnt sich an LoongFlow (ein Denk- und Lernrahmen für erfahrene KI-Agenten) derselben Reihe an. Der Name „LoongForge“ leitet sich vom traditionellen chinesischen Drachenboot ab, was bedeutet, gemeinsam die Wellen zu brechen. Seit Juli 2026 verfügt das GitHub-Repository über mehr als 150 Sterne und sorgt für ein hohes Maß an Community-Aktivität. Der Engineering-Blog des Teams aktualisiert regelmäßig ausführliche technische Artikel zu Themen wie heterogenes paralleles Training, DP-Lastausgleich, VLA-Modellbeschleunigung usw. Der Inhalt ist von hoher Qualität, was darauf hinweist, dass das Projektteam weiterhin in Technologie investiert hat.

  • Die Kernpositionierung von LoongForge ist klar: ein Framework, vier Modi. Seine Architektur ist in drei Schichten unterteilt: Die Modellschicht ist für die einheitliche Abstraktion verantwortlich, die Systemschicht konzentriert sich auf die End-to-End-Optimierung und die Hardwareschicht löst die plattformübergreifende Anpassung. Auf der Modellebene baute LoongForge eine Modellabstraktionsschicht auf Megatron-LM auf und zerlegte das multimodale Modell in drei Teile: die Wahrnehmungskodierungsschicht (Encoder), die Generations-Backbone-Schicht (Foundation) und die kombinierte Planungsschicht. Um auf ein neues Modell zuzugreifen, müssen Sie lediglich die entsprechenden Komponenten registrieren und dann das Modulspleißen und die parallele Strategiekonfiguration über eine YAML-Konfigurationsdatei abschließen, ohne den zugrunde liegenden Code neu zu schreiben. Im eigentlichen Test benötigte das Team nur wenige Tage, um den neuen visuellen Encoder RICE-ViT von LLaVA-OneVision anzupassen. Verglichen mit dem mehrwöchigen Anpassungszyklus der herkömmlichen Lösung gab es eine erhebliche Lücke. Wenn Sie das Sprachrückgrat von Qwen3.5 durch DeepSeek V3 ersetzen möchten, müssen Sie nur den YAML-Referenzpfad in einer Zeile ändern. Es ist nicht erforderlich, das gesamte Lager aufzuteilen. Die Optimierung auf Systemebene ist intensiver. Für die LLM-Basis implementiert LoongForge die CCT-Berechnung und Übertragungsparallelität und orchestriert die Berechnung, Kommunikation und Datenübertragung des MoE-Modells im Langsequenztraining einheitlich. Die gemessene Qwen3-30B-A3B-Trainingsleistung stieg unter der Sequenzlänge von 32 KB um 16 %. Die ChunkPipe-Pipeline-Parallelität löst den Speicherengpass extrem langer Sequenzen und ermöglicht die Ausführung von Millionen von Kontextfenstern auf kleinen und mittelgroßen Clustern. Für die DSA-Architektur mit spärlicher Aufmerksamkeit von DeepSeek V3.2 hat LoongForge eine tiefe Operatorfusion und -optimierung für die gesamte Aufmerksamkeitsberechnungsverbindung durchgeführt und so die End-to-End-Leistung um etwa das Fünffache verbessert. Auf der Seite der multimodalen Optimierung ist der DP-Lastausgleichsmechanismus besonders wichtig. Wenn die herkömmliche Datenparallelität auf multimodale Daten mit extrem ungleichmäßiger Länge stößt (etwa 256 Token für ein einzelnes Bild und mehr als 100.000 Token für ein 20-minütiges Video), führt die quadratische Varianz der Sequenzlänge dazu, dass der tatsächliche Rechenaufwand jeder GPU bei einer schnellen Karte und einer langsamen Karte sehr unterschiedlich ist. LoongForge ordnet die Probenzuteilung vor jeder Iteration dynamisch neu und verringert so die Lastlücke zwischen den Rängen erheblich. Dies ist auch eine wichtige Unterstützung dafür, eine lineare Erweiterungseffizienz von über 90 % auf einem Kakunlun P800-Cluster mit mehr als 5000 zu erreichen.Die modellheterogene Parallelität löst das Effizienzproblem, das durch den hundertfachen Unterschied in der Parameterskala zwischen Vision Transformer und LLM verursacht wird, und ermöglicht ihnen die unabhängige Konfiguration optimaler Parallelstrategien. Der gemessene Durchsatz von Qwen3-VL-30B stieg im Vergleich zur Community-Lösung unter der 32K-Sequenz um 45 %. Das Plug-in-Design der Hardwareschicht ist ein differenzierter Vorteil von LoongForge. Die GPU-Seite stellt nativ über PyTorch/CUDA eine Verbindung zu Megatron her, und die XPU-Seite verwendet das XPU_Plugin-Plug-in, um die zugrunde liegenden Schnittstellenunterschiede zu kapseln. Derselbe Trainingscode muss nur eine Umgebungsvariable ändern, um nahtlos zwischen NVIDIA GPU und Kunlun XPU zu wechseln. Für Teams, die Schulungen für verschiedene Hardwarebereitstellungen durchführen müssen, bedeutet dies, dass sie nicht zwei Codesätze verwalten und verteilte Logik aufgrund sich ändernder Hardware nicht neu schreiben müssen. Was das Benutzererlebnis angeht, knüpft LoongForge an die Gewohnheiten der Megatron-Benutzer an. Die grundlegenden

  • LoongForge ist Open Source und verwendet das Apache-2.0-Protokoll. Der Quellcode ist kostenlos und verfügbar. Es gibt keinen Berechtigungsunterschied zwischen der Community-Version und der Enterprise-Version. Als Trainingsinfrastruktur besteht der Kommerzialisierungspfad nicht darin, Softwarelizenzen direkt zu verkaufen, sondern mehr Teams für die Nutzung von LoongForge auf der Rechenleistungsplattform von Baidu Baige zu gewinnen, was die Nachfrage nach der Rechenleistungsmiete und den KI-Plattformdiensten von Baidu Smart Cloud steigert. Dies steht im Einklang mit dem gemeinsamen Geschäftsmodell früherer Open-Source-KI-Frameworks – das Framework selbst ist kostenlos, und je stärker die Fähigkeiten und je größer das Ökosystem, desto stärker ist die Anziehungskraft auf Upstream-Computing-Dienste. Dank des Designs von XPU_Plugin müssen Benutzer, die LoongForge auf dem Baidu Kunlun-Kern ausführen, keine zusätzlichen Anpassungen vornehmen, und Benutzer, die NVIDIA-GPUs verwenden, sind nicht betroffen. Die Zielbenutzer sind relativ klar: Teams, die Vorschulungen oder umfangreiche Feinabstimmungen durchführen, insbesondere diejenigen, die gezwungen waren, gleichzeitig vier verschiedene Trainingsstapel für Sprache, visuell-linguistische, Diffusion und Robotik zu verwalten. Für Einzel-GPU-Benutzer oder Teams, die nur Rückschlüsse ziehen, ist es wenig attraktiv – das ist typisch für Cluster-Tools.

  • Es ist etwa drei Monate her, seit LoongForge offiziell Open Source war, und das Community-Feedback steckt noch in den Kinderschuhen. Den Interaktionen auf GitHub Issues und Engineering-Blogs nach zu urteilen, ist die Reaktion der technischen Community im Allgemeinen positiv. Die positiven Kommentare konzentrieren sich auf mehrere Aspekte: Erstens trifft die Positionierung eines „einen Rahmens, der alle Modi abdeckt“ den eigentlichen Schmerzpunkt. In einigen Benutzerkommentaren wurde erwähnt, dass „es endlich nicht mehr nötig ist, zwischen Megatron, LeRobot und Diffusions-Frameworks hin und her zu wechseln“; Zweitens sind die Leistungsdaten relativ solide und ein unabhängiger Analyseartikel der externen Bewertungsseite besthub.dev bestätigte die mehr als fünffache Beschleunigungsleistung beim DSA-Modell. Drittens liegen die unterschiedlichen Vorteile des Dual-Hardware-Backends auf der Hand und werden in Community-Vergleichsartikeln oft als LoongForge angesehen. Der Hauptunterschied zwischen Megatron-LM und DeepSpeed ​​besteht darin, dass die beiden letzteren keine native Unterstützung auf Kunlun-Kernen bieten. Auch negative Kommentare und kontroverse Punkte verdienen Beachtung: Erstens befindet sich das Framework noch in einem frühen Stadium (v0.1.0) und einige Funktionen (z. B. die Stabilität der Checkpoint-Formatkonvertierung) werden noch kontinuierlich iteriert; Zweitens ist der Installations- und Bereitstellungsschwellenwert hoch und basiert derzeit auf Docker-Images oder der Kompilierung des Quellcodes, was bestimmte Erfahrung in der technischen Konfiguration erfordert. Drittens verfügt das Projekt derzeit nur über mehr als 150 Sterne, was weit hinter der Reife von Megatron-LM zurückbleibt, und das Community-Beitrags-Ökosystem hat noch keine Skala gebildet. Einige Benutzer berichteten auch, dass das Dokument weiterer Verbesserungen bedarf, insbesondere dass einige Kapitel der chinesischen Version des Dokuments noch Übersetzungsspuren aufweisen.

  • Der KI-Trainings-Framework-Track, auf dem sich LoongForge befindet, hat mittlerweile mehrere klare Schichten gebildet. Im Bereich der LLM-Ausbildung sind NVIDIAs Megatron-LM und Microsofts DeepSpeed ​​die De-facto-Industriestandards. Ersteres wurde weithin für die Durchführung groß angelegter verteilter Schulungen eingesetzt, und letzteres ist für seine ZeRO-Optimierungsserie bekannt. Zusätzlich zu diesen beiden Frameworks gibt es auch LLaMA-Factory, Axolotl zur Feinabstimmung von Szenarien und Transformers of the Hugging Face-Ökosystem. Die Einzigartigkeit von LoongForge besteht darin, dass es sich nicht um ein reines LLM-Trainings-Framework handelt, sondern um ein „Aggregations“-Framework, das versucht, mehrere Modalitäten zu verbinden. Es erbt die Parallelstrategie von Megatron-LM als LLM-Basis, ergänzt die VLM-Entkopplung visueller Komponenten und die VLA-Unterstützung für verkörperte Modelle, die im LLM-Framework im Allgemeinen fehlen, und ist abwärtskompatibel mit dem Diffusionsmodell. Die Industriemedien 36kr und mehrere Technologie-Self-Media-Berichte glauben im Allgemeinen, dass diese Positionierung „pragmatisch“ ist – sie erhebt nicht den Anspruch, irgendjemanden zu ersetzen, sondern die Lücken in multimodalen Szenarien wie Megatron-LM zu schließen. Es ist erwähnenswert, dass LoongForge eine einzigartige Position im heimischen Chip-Ökosystem einnimmt. Derzeit bieten gängige Open-Source-Schulungsframeworks im Allgemeinen nur schwache Unterstützung für inländische Chips, und die native Kunlun-XPU-Unterstützung von LoongForge macht es nahezu konkurrenzlos in inländischen Rechenleistungsszenarien. Dieser Vorteil könnte sich noch verstärken, da der Anteil heimischer Chips in der Ausbildung großer Modelle weiter zunimmt.

  • Das Hauptrisiko bei LoongForge liegt derzeit in seiner Reife. Bei der Version v0.1.0 handelt es sich noch um eine frühe Version, und die Umgebungskonfigurationsprobleme, auf die einige Benutzer während der Bereitstellung gestoßen sind, wurden noch nicht vollständig verarbeitet. Verglichen mit den Tausenden von Megatron-LM-Stars auf GitHub und der riesigen Zahl an Community-Mitwirkenden ist die Community-Ökologie von LoongForge noch lange nicht ausgereift, und die langfristige Wartung und Entwicklung hängt in hohem Maße von den kontinuierlichen Investitionen des Baidu Baige-Teams ab. Wenn sich die internen strategischen Prioritäten von Baidu ändern, kann dies Auswirkungen auf den Iterationsrhythmus des Frameworks haben. Obwohl das Trainingssubsystem für verkörperte Modelle von LoongForge auf technischer Ebene eine klare Designidee hat, entwickelt sich die Reife des Bereichs der verkörperten Intelligenz selbst immer noch schnell weiter, und Standards für gängige Politikmodelle wurden noch nicht gebildet, was bedeutet, dass die Kompatibilität des Frameworks in der verkörperten Richtung möglicherweise dem Druck kontinuierlicher Iterationen ausgesetzt sein kann. Darüber hinaus sind Fragen, die weiterhin Aufmerksamkeit verdienen, ob die Optimierungstiefe des Kunlun

  • Das Teamprofil, für das LoongForge am besten geeignet ist: Diejenigen, die ein groß angelegtes Modell-Vortraining oder eine groß angelegte Feinabstimmung unter Verwendung mehrerer Modalitäten (LLM + VLM oder LLM + Diffusion oder komplexere Kombinationen) durchführen, haben das Gefühl, dass die Kosten für die Wartung mehrerer Sätze von Trainings-Frameworks steigen, und möchten die Möglichkeit behalten, flexibel zwischen zwei Hardwareplattformen zu wechseln. Für diejenigen Teams, die zur Feinabstimmung nur Klartext-LLM verwenden, kann es einfacher und effizienter sein, direkt LLaMA-Factory oder Hugging Face’s Trainer zu verwenden. Wenn sich ein Team ausschließlich auf NVIDIA-GPUs verlässt und kein verkörpertes Modelltraining benötigt, bleibt die aktuelle Version von Megatron-LM oder DeepSpeed ​​​​eine sicherere Wahl.

  • LoongForge ist ein vollmodales Trainingsframework mit klarer Positionierung und pragmatischem Design. Es hat einen differenzierten Wert bei der Reduzierung der Komplexität multimodaler Schulungsprojekte und der Öffnung des heimischen Chip-Ökosystems erzielt. Es handelt sich nicht um ein Framework, das versucht, „die Welt zu erobern“, sondern die Lücken im bestehenden Technologie-Stack in multimodalen Szenarien zu schließen. Wenn Teams bereits den Druck der Engineering-Kosten im multimodalen Training spüren, lohnt es sich, dieses Projekt im Auge zu behalten. Positives Feedback aus der Open-Source-Community und kontinuierliche Versionsiteration werden Schlüsselfaktoren dafür sein, ob es sich wirklich zu einer Lösung auf Industrieniveau entwickeln kann.

Nutzerbewertungen

  • Avatar
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • Avatar
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • Avatar
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • Avatar
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • Avatar
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • Avatar
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • Avatar
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • Avatar
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • Avatar
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • Avatar
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • Avatar
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • Avatar
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • Avatar
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • Avatar
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • Avatar
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • Avatar
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • Avatar
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • Avatar
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • Avatar
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • Avatar
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • Avatar
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • Avatar
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • Avatar
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • Avatar
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • Avatar
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • Avatar
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • Avatar
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • Avatar
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • Avatar
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • Avatar
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。