LoongForge

إطار تدريب متعدد الوسائط مفتوح المصدر من بايدو بايغه: يغطي تدريب نماذج LLM وVLM ونماذج الانتشار والذكاء الاصطناعي المتجسد ضمن إطار موحد واحد، مع دعم أصلي لوحدات NVIDIA GPU وشرائح Kunlunxin XPU

تقرير معمّق

  • LoongForge هو إطار تدريب كامل الوسائط ومفتوح المصدر رسميًا من Baidu Baige، والذي تطور من مكدس تسريع التدريب الداخلي AIAK-Training-LLM. ويستخدم إطارًا موحدًا لتغطية الاحتياجات التدريبية لأربعة أنماط: نموذج اللغة الكبير (LLM)، ونموذج اللغة المرئية (VLM)، ونموذج الانتشار (Diffusion)، والذكاء المتجسد (Embodied). إنه يحقق تسريعًا شاملاً للتدريب بنسبة 15% إلى 50% على النماذج السائدة، ويدعم أصلاً منصات الأجهزة المزدوجة NVIDIA GPU وKunlun XPU. شهد الإطار التحقق من صحة الإنتاج على نطاق واسع مع عملاء المؤسسات في مجالات التعليم والرؤية الحاسوبية والذكاء المتجسد، مع حجم كتلة أقصى يزيد عن 5000 مسرع، وهو مفتوح المصدر باستخدام بروتوكول Apache-2.0.

  • سلف LoongForge هو AIAK-Training-LLM، وهو إطار تسريع التدريب طويل المدى المستخدم داخليًا بواسطة Baidu Baige. قبل أن يصبح مفتوح المصدر رسميًا، كان قد صمدت بالفعل لاختبارات مستوى الإنتاج بين عملاء المؤسسات في العديد من الصناعات - وقد تم تنفيذ جميع نماذج التدريب على السيناريوهات التعليمية، والمهام متعددة الوسائط في رؤية الكمبيوتر، ونماذج الذكاء المتجسد VLA (اللغة المرئية والحركة). في أبريل 2026، قررت Baidu Baige فتح المصدر رسميًا وأطلقت عليه اسم LoongForge، لتنضم إلى سلسلة Baige Loong مفتوحة المصدر، مرددة صدى LoongFlow (إطار عمل للتفكير والتعلم لعملاء الذكاء الاصطناعي الخبراء) من نفس السلسلة. اسم "LoongForge" مأخوذ من قارب التنين الصيني التقليدي، وهو ما يعني العمل معًا لكسر الأمواج. اعتبارًا من يوليو 2026، يضم مستودع GitHub الخاص به أكثر من 150 نجمة ويحافظ على مستوى عالٍ من نشاط المجتمع. تقوم المدونة الهندسية للفريق بانتظام بتحديث المقالات الفنية المتعمقة، والتي تغطي موضوعات مثل التدريب المتوازي غير المتجانس، وموازنة تحميل DP، وتسريع نموذج VLA، وما إلى ذلك. المحتوى عالي الجودة، مما يشير إلى أن فريق المشروع واصل الاستثمار في التكنولوجيا.

  • إن الموقع الأساسي لـ LoongForge واضح: إطار عمل واحد وأربعة أوضاع. تنقسم بنيتها إلى ثلاث طبقات - طبقة النموذج مسؤولة عن التجريد الموحد، وطبقة النظام تركز على التحسين الشامل، وطبقة الأجهزة تعمل على حل التكيف عبر الأنظمة الأساسية. في طبقة النموذج، قامت LoongForge ببناء طبقة من تجريد النموذج فوق Megatron-LM، مما أدى إلى تحليل النموذج متعدد الوسائط إلى ثلاثة أجزاء: طبقة التشفير الإدراكي (Encoder)، وطبقة الجيل الأساسية (Foundation)، وطبقة الجدولة المدمجة. للوصول إلى نموذج جديد، ما عليك سوى تسجيل المكونات المقابلة، ثم إكمال ربط الوحدة النمطية وتكوين الإستراتيجية المتوازية من خلال ملف تكوين YAML دون إعادة كتابة الكود الأساسي. في الاختبار الفعلي، استغرق الأمر من الفريق بضعة أيام فقط لتكييف جهاز التشفير المرئي الجديد الخاص بـ LLaVA-OneVision RICE-ViT. ومقارنة بدورة التكيف مع الحل التقليدي التي تستغرق عدة أسابيع، كانت هناك فجوة كبيرة. إذا كنت تريد استبدال العمود الفقري للغة Qwen3.5 بـ DeepSeek V3، فأنت تحتاج فقط إلى تغيير المسار المرجعي YAML في سطر واحد. ليست هناك حاجة لشوكة المستودع بأكمله. يعد التحسين على مستوى النظام أكثر كثافة. بالنسبة لقاعدة LLM، تطبق LoongForge حساب CCT وتوازي الإرسال، وتقوم بتنسيق الحساب والاتصالات ونقل البيانات بشكل موحد لنموذج MoE في تدريب طويل التسلسل. زاد أداء التدريب Qwen3-30B-A3B المُقاس بنسبة 16% تحت طول التسلسل 32 كيلو بايت. يعمل توازي خط أنابيب ChunkPipe على حل عنق الزجاجة في الذاكرة للتسلسلات الطويلة جدًا، مما يسمح لملايين نوافذ السياق بالعمل على مجموعات صغيرة ومتوسطة الحجم. بالنسبة لبنية الاهتمام المتناثر DSA في DeepSeek V3.2، قامت LoongForge بإجراء دمج عميق للمشغل وتحسين رابط حساب الاهتمام بالكامل، مما أدى إلى تحسين الأداء الشامل بنحو 5 مرات. ومن ناحية تحسين الوسائط المتعددة، تعد آلية موازنة التحميل DP أمرًا بالغ الأهمية بشكل خاص. عندما يواجه توازي البيانات التقليدي بيانات متعددة الوسائط ذات أطوال غير متساوية للغاية (حوالي 256 رمزًا مميزًا لصورة واحدة، وأكثر من 100000 رمزًا مميزًا لمقطع فيديو مدته 20 دقيقة)، فإن التباين التربيعي لطول التسلسل سيؤدي إلى اختلاف مقدار الحساب الفعلي لكل وحدة معالجة رسومات (GPU) تمامًا، مع بطاقة سريعة وبطاقة بطيئة. يقوم LoongForge بإعادة ترتيب تخصيص العينة ديناميكيًا قبل كل تكرار، مما يؤدي إلى تضييق فجوة التحميل بين الرتب بشكل كبير. يعد هذا أيضًا دعمًا رئيسيًا لها لتحقيق كفاءة توسع خطي بنسبة 90%+ على مجموعة 5000+ Kakunlun P800.يعمل نموذج التوازي غير المتجانس على حل مشكلة الكفاءة الناتجة عن اختلاف مئات المرات في مقياس المعلمة بين Vision Transformer وLLM، مما يسمح لهم بتكوين الاستراتيجيات المتوازية المثالية بشكل مستقل. زادت الإنتاجية المقاسة لـ Qwen3-VL-30B بنسبة 45% مقارنة بحل المجتمع ضمن تسلسل 32K. يعد تصميم المكونات الإضافية لطبقة الأجهزة ميزة مميزة لـ LoongForge. يتصل جانب وحدة معالجة الرسومات بـ Megatron أصلاً من خلال PyTorch/CUDA، ويستخدم جانب XPU المكون الإضافي XPU_Plugin لتغليف اختلافات الواجهة الأساسية. يحتاج رمز التدريب نفسه فقط إلى تغيير متغير بيئة واحد للتبديل بسلاسة بين NVIDIA GPU وKunlun XPU. بالنسبة للفرق التي تحتاج إلى التدريب عبر عمليات نشر الأجهزة، فهذا يعني عدم الحاجة إلى الاحتفاظ بمجموعتين من التعليمات البرمجية، وعدم الحاجة إلى إعادة كتابة المنطق الموزع بسبب تغيير الأجهزة. فيما يتعلق بتجربة المستخدم، تواصل LoongForge عادات مستخدمي Megatron. تتوافق معلمات التدريب الأساسية مع Megatron، كما أن أنماط التكوين المتوازي لخطوط الأنابيب والبيانات متشابهة. يتم تنفيذ التكوين المستقل على مستوى المكونات (مثل استخدام أحجام TP مختلفة للمشفر المرئي والعمود الفقري للغة) من خلال Hydra، والذي لا ينبغي أن يكون صعبًا للغاية بالنسبة للفرق التي لديها بعض الخبرة في التدريب الموزع للبدء. تم أيضًا تضمين سلسلة أدوات المعالجة المسبقة للبيانات وأدوات التحويل دون اتصال لأوزان HuggingFace. يدعم الإصدار الحالي (الإصدار 0.1.0، الذي تم إصداره في مايو 2026) أكثر من 20 عائلة نموذجية، تغطي دورات LLM السائدة مثل DeepSeek (V2/V3/V3.2/V4)، Qwen (السلسلة الكاملة 0.6B–480B)، LLaMA (2/3/3.1)، MiniMax، GLM؛ دعم جانبي VLM Qwen2.5/3-VL، وInternVL2.5/3.5، وKimi-K2.5/K2.6، وERNIE4.5-VL، وما إلى ذلك؛ يدعم نموذج الانتشار Wan2.1/2.2 وQwen-Image؛ يغطي الطراز المتجسد Pi0.5، وGR00T N1.6/N1.7، وX-VLA، وFastWAM، ونماذج الحركة العالمية المتعددة. تعد تغطية النموذج هذه حاليًا واحدة من أوسع نطاقات أطر التدريب

  • LoongForge مفتوح المصدر باستخدام بروتوكول Apache-2.0. كود المصدر مجاني ومتوفر. لا يوجد تمييز في الأذونات بين إصدار المجتمع وإصدار المؤسسة. وباعتبارها بنية تحتية للتدريب، فإن مسار التسويق الخاص بها لا يتمثل في بيع تراخيص البرامج مباشرة، ولكن لجذب المزيد من الفرق لاستخدام LoongForge على منصة طاقة الحوسبة الخاصة بـ Baidu Baige، مما يزيد الطلب على خدمات تأجير طاقة الحوسبة ومنصة الذكاء الاصطناعي من Baidu Smart Cloud. يتوافق هذا مع نموذج العمل المشترك لأطر الذكاء الاصطناعي مفتوحة المصدر السابقة - الإطار نفسه مجاني، وكلما كانت القدرات أقوى والنظام البيئي أكبر، كان الجذب أقوى لخدمات الحوسبة الأولية. بفضل تصميم XPU_Plugin، لا يحتاج المستخدمون الذين يقومون بتشغيل LoongForge على Baidu Kunlun إلى إجراء تعديلات إضافية، ولا يتأثر المستخدمون الذين يستخدمون وحدات معالجة الرسومات NVIDIA. المستخدمون المستهدفون واضحون نسبيًا: الفرق التي تقوم بالتدريب المسبق أو الضبط الدقيق على نطاق واسع، خاصة تلك التي اضطرت إلى الحفاظ على أربع مجموعات تدريبية مختلفة للغة، والبصرية اللغوية، والانتشار، والروبوتات في نفس الوقت. إنها لا تحظى بجاذبية كبيرة لمستخدمي وحدة معالجة الرسومات الفردية أو الفرق التي تقوم بالاستدلال فقط - وهذا نموذجي للأدوات على نطاق المجموعة.

  • لقد مر حوالي ثلاثة أشهر منذ أن أصبح LoongForge مفتوح المصدر رسميًا، ولا تزال تعليقات المجتمع في المراحل الأولى من التراكم. انطلاقًا من التفاعلات حول مشكلات GitHub والمدونات الهندسية، فإن رد فعل المجتمع التقني إيجابي بشكل عام. تركز التعليقات الإيجابية على عدة جوانب: أولاً، إن وضع "إطار عمل واحد يغطي جميع الأوضاع" يمثل نقطة الألم الفعلية. ذكرت بعض تعليقات المستخدمين أنه "أخيرًا ليست هناك حاجة للتبديل بين أطر عمل Megatron وLeRobot وأطر الانتشار"؛ ثانيًا، بيانات الأداء قوية نسبيًا، وقد أقرت مقالة تحليلية مستقلة أجراها موقع التقييم التابع لجهة خارجية besthub.dev بأداء تسريع أكثر من 5 مرات في نموذج DSA؛ ثالثًا، المزايا التفاضلية للواجهة الخلفية للأجهزة المزدوجة واضحة، وغالبًا ما يُنظر إليها على أنها LoongForge في مقالات المقارنة المجتمعية. الفرق الأساسي بين Megatron-LM وDeepSpeed ​​هو أن الأخيرين ليس لهما دعم أصلي على نوى Kunlun. التعليقات السلبية والنقاط المثيرة للجدل تستحق الاهتمام أيضًا: أولاً، لا يزال إطار العمل في المرحلة المبكرة (الإصدار 0.1.0)، ولا تزال بعض الوظائف (مثل استقرار تحويل تنسيق نقطة التفتيش) قيد التكرار المستمر؛ ثانيًا، عتبة التثبيت والنشر مرتفعة، وتعتمد حاليًا على صور Docker أو تجميع التعليمات البرمجية المصدر، الأمر الذي يتطلب خبرة معينة في التكوين الهندسي؛ ثالثًا، يحتوي المشروع حاليًا على أكثر من 150 نجمًا فقط، وهو متأخر جدًا عن نضج Megatron-LM، ولم يشكل النظام البيئي لمساهمة المجتمع نطاقًا بعد. كما أفاد بعض المستخدمين أن الوثيقة تحتاج إلى مزيد من التحسين، خاصة أن بعض فصول النسخة الصينية من الوثيقة لا تزال تحمل آثار الترجمة.

  • لقد شكل مسار إطار تدريب الذكاء الاصطناعي حيث يقع LoongForge الآن عدة طبقات واضحة. في مجال تدريب LLM، تعد Megatron-LM من NVIDIA و DeepSpeed ​​من Microsoft هي معايير الصناعة الفعلية. تم اعتماد الأول على نطاق واسع لأداء التدريب الموزع على نطاق واسع، والأخير معروف بسلسلة التحسين ZeRO الخاصة به. بالإضافة إلى هذين الإطارين، هناك أيضًا LLaMA-Factory وAxolotl لسيناريوهات الضبط الدقيق ومحولات النظام البيئي Hugging Face. إن ما يميز LoongForge هو أنه ليس إطارًا تدريبيًا خالصًا لـ LLM، ولكنه إطار عمل "تجميعي" يحاول ربط طرائق متعددة. إنها ترث الإستراتيجية الموازية لـ Megatron-LM كقاعدة LLM، وتكمل فصل المكونات المرئية VLM ودعم نموذج VLA المتجسد المفقود عمومًا في إطار LLM، وهي متوافقة مع الإصدارات السابقة مع نموذج الانتشار. تعتقد وسائل الإعلام الصناعية 36kr وتقارير وسائل الإعلام الذاتية المتعددة التقنية عمومًا أن هذا الوضع "عملي" - فهو لا يدعي أنه يحل محل أي شخص، ولكنه يملأ الفجوات في السيناريوهات متعددة الوسائط مثل Megatron-LM. ومن الجدير بالذكر أن LoongForge تحتل مكانة فريدة في النظام البيئي للرقائق المحلية. في الوقت الحاضر، تتمتع أطر التدريب مفتوحة المصدر السائدة عمومًا بدعم ضعيف للرقائق المحلية، كما أن دعم Kunlun XPU الأصلي من LoongForge يجعلها تقريبًا بدون منافسة مباشرة في سيناريوهات قوة الحوسبة المحلية. ويمكن تضخيم هذه الميزة بشكل أكبر مع استمرار زيادة نسبة الرقائق المحلية في تدريب النماذج الكبيرة.

  • الخطر الرئيسي مع LoongForge في هذه المرحلة ينبع من نضجها. لا يزال الإصدار v0.1.0 إصدارًا مبكرًا، ولم يتم استيعاب مشكلات تكوين البيئة التي واجهها بعض المستخدمين أثناء النشر بشكل كامل. بالمقارنة مع آلاف نجوم Megatron-LM على GitHub والنطاق الضخم للمساهمين المجتمعيين، فإن بيئة مجتمع LoongForge بعيدة كل البعد عن النضج، وتعتمد الصيانة والتطوير على المدى الطويل بشكل كبير على الاستثمار المستمر لفريق Baidu Baige. إذا تغيرت الأولويات الإستراتيجية الداخلية لبايدو، فقد يتأثر إيقاع تكرار الإطار. على المستوى الفني، على الرغم من أن النظام الفرعي للتدريب النموذجي المتجسد في LoongForge لديه فكرة تصميمية واضحة، فإن نضج مجال الذكاء المتجسد نفسه لا يزال يتطور بسرعة، ولم يتم تشكيل معايير لنماذج السياسة السائدة بعد، مما يعني أن توافق الإطار في الاتجاه المتجسد قد يواجه ضغط التكرارات المستمرة. بالإضافة إلى ذلك، ما إذا كان عمق تحسين إطار العمل لـ Kunlun XPU يعتمد ضمنيًا على أجهزة معينة، وما إذا كان يمكن إعادة إنتاج هذا التحسين بواسطة فريق خارجي بتكلفة منخفضة دون الاعتماد على قوة الحوسبة الداخلية لـ Baidu، فهي أيضًا قضايا تستحق الاهتمام المستمر.

  • ملف تعريف الفريق الذي يعتبر LoongForge هو الأكثر ملاءمة له: أولئك الذين يقومون بالتدريب المسبق للنموذج على نطاق واسع أو الضبط الدقيق على نطاق واسع، باستخدام طرائق متعددة (LLM + VLM أو LLM + نشر أو مجموعات أكثر تعقيدًا)، شعروا أن تكلفة الحفاظ على مجموعات متعددة من أطر التدريب آخذة في الارتفاع، ويريدون الاحتفاظ بالقدرة على التبديل بمرونة بين منصتين للأجهزة. بالنسبة لتلك الفرق التي تستخدم LLM بنص عادي فقط من أجل الضبط الدقيق، قد يكون استخدام LLaMA-Factory أو Hugging Face’s Trainer أكثر خفة وفعالية. إذا كان الفريق يعتمد فقط على وحدات معالجة الرسومات NVIDIA ولا يحتاج إلى تدريب نموذجي مجسد، فإن الإصدار الحالي من Megatron-LM أو DeepSpeed ​​يظل خيارًا أكثر أمانًا.

  • LoongForge هو إطار تدريبي متكامل مع تحديد موضع واضح وتصميم عملي. لقد حققت قيمة متباينة في تقليل تعقيد مشاريع التدريب متعددة الوسائط وفتح النظام البيئي للرقائق المحلية. إنه ليس إطارًا يحاول "غزو العالم"، بل يحاول سد الثغرات الموجودة في مجموعة التكنولوجيا الحالية في سيناريوهات متعددة الوسائط. إذا كانت الفرق تشعر بالفعل بضغط التكاليف الهندسية في التدريب متعدد الوسائط، فإن هذا المشروع يستحق الاهتمام. ستكون التعليقات الإيجابية من مجتمع المصادر المفتوحة والتكرار المستمر للإصدار من المتغيرات الرئيسية في ما إذا كان يمكن أن يتحول حقًا إلى حل على المستوى الصناعي.

مراجعات المستخدمين

  • الصورة الرمزية
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • الصورة الرمزية
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • الصورة الرمزية
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • الصورة الرمزية
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • الصورة الرمزية
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • الصورة الرمزية
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • الصورة الرمزية
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • الصورة الرمزية
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • الصورة الرمزية
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • الصورة الرمزية
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • الصورة الرمزية
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • الصورة الرمزية
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • الصورة الرمزية
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • الصورة الرمزية
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • الصورة الرمزية
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • الصورة الرمزية
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • الصورة الرمزية
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • الصورة الرمزية
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • الصورة الرمزية
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • الصورة الرمزية
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • الصورة الرمزية
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • الصورة الرمزية
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • الصورة الرمزية
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • الصورة الرمزية
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • الصورة الرمزية
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • الصورة الرمزية
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • الصورة الرمزية
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • الصورة الرمزية
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • الصورة الرمزية
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • الصورة الرمزية
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。