LoongForge

Омнимодальный фреймворк обучения с открытым кодом от Baidu Baige: покрывает обучение LLM, VLM, диффузионных моделей и воплощённого ИИ в едином фреймворке, с нативной поддержкой GPU NVIDIA и XPU Kunlunxin

Подробный отчёт

  • LoongForge — это недавно официально открытая полномодальная система обучения Baidu Baige, которая возникла на основе внутреннего стека ускорения обучения AIAK-Training-LLM. Он использует унифицированную структуру для покрытия потребностей в обучении в четырех режимах: модель большого языка (LLM), модель визуального языка (VLM), модель диффузии (Diffusion) и воплощенный интеллект (Embodied). Он обеспечивает ускорение сквозного обучения на 15–50 % на основных моделях и изначально поддерживает двойные аппаратные платформы NVIDIA GPU и Kunlun XPU. Платформа прошла крупномасштабную производственную проверку с корпоративными клиентами в области образования, компьютерного зрения и встроенного интеллекта, с максимальным размером кластера более 5000 ускорителей и имеет открытый исходный код, использующий протокол Apache-2.0.

  • Предшественником LoongForge является AIAK-Training-LLM, система ускорения долгосрочного обучения, используемая внутри компании Baidu Baige. Прежде чем он был официально открыт с открытым исходным кодом, он уже выдержал испытания на уровне производства среди корпоративных клиентов в различных отраслях: были реализованы модели обучения в образовательных сценариях, мультимодальные задачи в компьютерном зрении и модели воплощенного интеллекта VLA (Visual-Language-Action). В апреле 2026 года Baidu Baige решила официально открыть исходный код и назвала его LoongForge, присоединившись к серии Baige Loong с открытым исходным кодом, перекликаясь с LoongFlow (системой мышления и обучения для опытных агентов ИИ) из той же серии. Название «LoongForge» взято от традиционной китайской лодки-дракона, что означает совместную работу по преодолению волн. По состоянию на июль 2026 года его репозиторий GitHub имеет более 150 звезд и поддерживает высокий уровень активности сообщества. В инженерном блоге команды регулярно обновляются подробные технические статьи, охватывающие такие темы, как гетерогенное параллельное обучение, балансировка нагрузки DP, ускорение модели VLA и т. д. Содержимое имеет высокое качество, что указывает на то, что команда проекта продолжает инвестировать в технологии.

  • Основное позиционирование LoongForge ясно: одна структура, четыре режима. Его архитектура разделена на три уровня: уровень модели отвечает за унифицированную абстракцию, системный уровень ориентирован на сквозную оптимизацию, а аппаратный уровень решает вопрос кросс-платформенной адаптации. На уровне модели LoongForge создал уровень абстракции модели поверх Megatron-LM, разложив мультимодальную модель на три части: уровень перцептивного кодирования (Кодировщик), магистральный уровень генерации (Основной) и комбинированный уровень планирования. Чтобы получить доступ к новой модели, вам нужно всего лишь зарегистрировать соответствующие компоненты, а затем выполнить объединение модулей и настройку параллельной стратегии через файл конфигурации YAML, не переписывая базовый код. В реальных испытаниях команде потребовалось всего несколько дней, чтобы адаптировать новый визуальный кодировщик LLaVA-OneVision RICE-ViT. По сравнению с циклом адаптации традиционного решения, длившимся несколько недель, существовал значительный разрыв. Если вы хотите заменить языковую основу Qwen3.5 на DeepSeek V3, вам нужно всего лишь изменить путь к ссылке YAML в одной строке. Нет необходимости раскошелиться на весь склад. Оптимизация на системном уровне более интенсивна. Для базы LLM LoongForge реализует параллелизм вычислений и передачи CCT, а также единообразно координирует вычисления, связь и передачу данных модели MoE при обучении с длинной последовательностью. Измеренная эффективность обучения Qwen3-30B-A3B увеличилась на 16% при длине последовательности 32 КБ. Параллелизм конвейера ChunkPipe устраняет узкое место в памяти, связанное со сверхдлинными последовательностями, позволяя запускать миллионы контекстных окон в кластерах малого и среднего размера. Для архитектуры разреженного внимания DSA в DeepSeek V3.2 компания LoongForge выполнила глубокое объединение операторов и оптимизацию на всем канале расчета внимания, улучшив сквозную производительность примерно в 5 раз. Что касается мультимодальной оптимизации, механизм балансировки нагрузки DP особенно важен. Когда традиционный параллелизм данных сталкивается с мультимодальными данными с крайне неравномерной длиной (около 256 токенов для одного изображения и более 100 000 токенов для 20-минутного видео), квадратичная разница длины последовательности приведет к тому, что фактический объем вычислений каждого графического процессора будет сильно различаться, с быстрой картой и медленной картой. LoongForge динамически перераспределяет выборку перед каждой итерацией, значительно сокращая разрыв в нагрузке между рангами. Это также является ключевой поддержкой для достижения эффективности линейного расширения более 90% на кластере Kakunlun P800 с более чем 5000 кластерами.Гетерогенный параллелизм модели решает проблему эффективности, вызванную разницей в сотни раз масштаба параметров между Vision Transformer и LLM, позволяя им независимо настраивать оптимальные стратегии параллельного параллелизма. Измеренная пропускная способность Qwen3-VL-30B увеличилась на 45% по сравнению с решением сообщества при последовательности 32К. Плагин аппаратного уровня является отличительным преимуществом LoongForge. Сторона графического процессора подключается к Megatron напрямую через PyTorch/CUDA, а сторона XPU использует плагин XPU_Plugin для инкапсуляции основных различий интерфейса. В одном и том же обучающем коде достаточно изменить только одну переменную среды, чтобы плавно переключаться между NVIDIA GPU и Kunlun XPU. Для команд, которым необходимо проводить обучение развертыванию оборудования, это означает отсутствие необходимости поддерживать два набора кода и переписывать распределенную логику из-за смены оборудования. С точки зрения пользовательского опыта, LoongForge продолжает привычки пользователей Megatron. Основные параметры обучения совместимы с Megatron, а стили конфигурации конвейера и параллельных данных аналогичны. Независимая конфигурация на уровне компонентов (например, использование разных

  • LoongForge имеет открытый исходный код и использует протокол Apache-2.0. Исходный код бесплатен и доступен. Между версией сообщества и корпоративной версией нет различий в разрешениях. В качестве инфраструктуры обучения ее путь коммерциализации заключается не в прямой продаже лицензий на программное обеспечение, а в привлечении большего числа команд для использования LoongForge на платформе вычислительных мощностей Baidu Baige, что стимулирует спрос на аренду вычислительных мощностей Baidu Smart Cloud и услуги платформы искусственного интеллекта. Это соответствует общей бизнес-модели предыдущих платформ искусственного интеллекта с открытым исходным кодом: сама платформа бесплатна, и чем больше возможностей и чем больше экосистема, тем сильнее тяга к вышестоящим вычислительным услугам. Благодаря конструкции XPU_Plugin пользователям, использующим LoongForge на ядре Baidu Kunlun, не нужно вносить дополнительные изменения, и это не затрагивает пользователей, использующих графические процессоры NVIDIA. Целевые пользователи относительно ясны: команды, проводящие предварительное обучение или крупномасштабную тонкую настройку, особенно те, которые были вынуждены одновременно поддерживать четыре различных пакета обучения для языка, визуально-лингвистического, диффузного и робототехники. Он мало привлекателен для пользователей с одним графическим процессором или групп, выполняющих только логические выводы — это типично для инструментов кластерного масштаба.

  • Прошло около трех месяцев с тех пор, как LoongForge был официально открыт с открытым исходным кодом, а отзывы сообщества все еще находятся на ранних стадиях сбора. Судя по взаимодействиям в GitHub Issues и инженерных блогах, реакция технического сообщества в целом положительная. Положительные комментарии сосредоточены на нескольких аспектах: во-первых, позиционирование «одной структуры, охватывающей все режимы» затрагивает реальную проблему. В некоторых комментариях пользователей упоминалось, что «наконец-то нет необходимости переключаться между Megatron, LeRobot и диффузионными фреймворками»; во-вторых, данные о производительности относительно достоверны, и в независимой аналитической статье стороннего оценочного сайта besthub.dev было отмечено более чем пятикратное ускорение производительности на модели DSA; в-третьих, отличительные преимущества двухаппаратного бэкэнда очевидны, и в статьях сообщества по сравнению их часто называют LoongForge. Основное отличие Megatron-LM от DeepSpeed ​​— у последних двух нет встроенной поддержки ядер Kunlun. Отрицательные комментарии и спорные моменты также заслуживают внимания: во-первых, фреймворк все еще находится на ранней стадии (v0.1.0), а некоторые функции (например, стабильность преобразования формата контрольных точек) все еще находятся в стадии постоянной итерации; во-вторых, порог установки и развертывания высок, и в настоящее время он опирается на образы Docker или компиляцию исходного кода, что требует определенного опыта инженерной настройки; в-третьих, в настоящее время в проекте всего более 150 звезд, что сильно отстает от зрелости Megatron-LM, а экосистема вклада сообщества еще не сформировала масштаб. Некоторые пользователи также сообщили, что документ нуждается в дальнейшем доработке, особенно то, что некоторые главы китайской версии документа все еще имеют следы перевода.

  • Система обучения искусственному интеллекту, где находится LoongForge, теперь сформировала несколько четких уровней. В области обучения LLM Megatron-LM от NVIDIA и DeepSpeed ​​от Microsoft являются де-факто отраслевыми стандартами. Первый широко применяется для проведения крупномасштабного распределенного обучения, а второй известен своей серией оптимизации ZeRO. Помимо этих двух фреймворков есть еще LLaMA-Factory, Axolotl для тонкой настройки сценариев и Трансформеры экосистемы Hugging Face. Уникальность LoongForge заключается в том, что это не чистая система обучения LLM, а система «агрегирования», которая пытается соединить несколько модальностей. Он наследует параллельную стратегию Megatron-LM в качестве основы LLM, дополняет развязку визуальных компонентов VLM и поддержку встроенной модели VLA, которые обычно отсутствуют в структуре LLM, и обратно совместим с моделью диффузии. Отраслевые СМИ 36kr и многочисленные технологические СМИ в целом полагают, что такое позиционирование является «прагматичным» — оно не претендует на замену кого-либо, а на заполнение пробелов в мультимодальных сценариях, таких как Megatron-LM. Стоит отметить, что LoongForge занимает уникальное положение в отечественной экосистеме чипов. В настоящее время основные обучающие системы с открытым исходным кодом, как правило, слабо поддерживают отечественные чипы, а встроенная поддержка LoongForge Kunlun XPU делает их практически лишенными прямой конкуренции в сценариях отечественной вычислительной мощности. Это преимущество может еще больше усилиться, поскольку доля отечественных чипов в обучении крупных моделей продолжает увеличиваться.

  • Основной риск LoongForge на данном этапе связан с его зрелостью. Версия v0.1.0 все еще является ранней версией, и проблемы с конфигурацией среды, с которыми сталкиваются некоторые пользователи во время развертывания, еще не полностью решены. По сравнению с тысячами звезд Megatron-LM на GitHub и огромным количеством участников сообщества, экология сообщества LoongForge далека от зрелости, а долгосрочное обслуживание и развитие во многом зависят от постоянных инвестиций команды Baidu Baige. Если внутренние стратегические приоритеты Baidu изменятся, это может повлиять на ритм итераций структуры. На техническом уровне, хотя подсистема обучения воплощенной модели LoongForge имеет четкую проектную идею, зрелость самой области воплощенной разведки все еще быстро развивается, а стандарты для основных моделей политики еще не сформированы, а это означает, что совместимость структуры в воплощенном направлении может столкнуться с давлением непрерывных итераций. Кроме того, постоянного внимания заслуживает также вопрос о том, имеет ли глубина оптимизации платформы Kunlun XPU неявную зависимость от конкретного оборудования и может ли эта оптимизация быть воспроизведена внешней командой с низкими затратами, не полагаясь на внутренние вычислительные мощности Baidu.

  • Профиль команды, для которого LoongForge больше всего подходит: те, кто выполняет крупномасштабное предварительное обучение модели или масштабную тонкую настройку, используя несколько модальностей (LLM + VLM или LLM + диффузия или более сложные комбинации), почувствовали, что стоимость поддержки нескольких наборов обучающих сред растет, и хотят сохранить возможность гибкого переключения между двумя аппаратными платформами. Для тех команд, которые используют только текстовый LLM для тонкой настройки, может быть более простым и эффективным напрямую использовать LLaMA-Factory или Hugging Face Trainer. Если команда полагается исключительно на графические процессоры NVIDIA и не требует встроенного обучения модели, текущая версия Megatron-LM или DeepSpeed ​​остается более безопасным выбором.

  • LoongForge — это полномодальная система обучения с четким позиционированием и прагматичным дизайном. Это внесло различный вклад в снижение сложности мультимодальных учебных проектов и открытие отечественной экосистемы чипов. Это не структура, которая пытается «завоевать мир», а заполнить пробелы в существующем стеке технологий в мультимодальных сценариях. Если команды уже ощущают давление инженерных затрат на мультимодальное обучение, за этим проектом стоит следить. Положительные отзывы сообщества открытого исходного кода и непрерывное обновление версий станут ключевыми факторами в том, сможет ли оно действительно превратиться в решение промышленного уровня.

Отзывы пользователей

  • аватар
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • аватар
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • аватар
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • аватар
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • аватар
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • аватар
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • аватар
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • аватар
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • аватар
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • аватар
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • аватар
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • аватар
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • аватар
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • аватар
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • аватар
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • аватар
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • аватар
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • аватар
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • аватар
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • аватар
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • аватар
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • аватар
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • аватар
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • аватар
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • аватар
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • аватар
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • аватар
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • аватар
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • аватар
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • аватар
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。