LoongForge

Baidu Baige का ओपन-सोर्स सर्व-मोडैलिटी ट्रेनिंग फ्रेमवर्क: एक ही एकीकृत फ्रेमवर्क में LLM, VLM, डिफ्यूज़न मॉडल और एम्बॉडीड AI का प्रशिक्षण, NVIDIA GPU और Kunlunxin XPU का नेटिव समर्थन

विस्तृत रिपोर्ट

  • लूंगफोर्ज Baidu Baige का हाल ही में आधिकारिक तौर पर खुला-स्रोत पूर्ण-मोडल प्रशिक्षण ढांचा है, जो आंतरिक प्रशिक्षण त्वरण स्टैक AIAK-ट्रेनिंग-एलएलएम से विकसित हुआ है। यह चार मोड की प्रशिक्षण आवश्यकताओं को कवर करने के लिए एक एकीकृत ढांचे का उपयोग करता है: बड़े भाषा मॉडल (एलएलएम), दृश्य भाषा मॉडल (वीएलएम), प्रसार मॉडल (डिफ्यूजन) और सन्निहित बुद्धि (एम्बोडिड)। यह मुख्यधारा के मॉडलों पर 15%-50% एंड-टू-एंड प्रशिक्षण त्वरण प्राप्त करता है, और मूल रूप से NVIDIA GPU और कुनलुन XPU दोहरे हार्डवेयर प्लेटफार्मों का समर्थन करता है। फ्रेमवर्क ने 5,000 से अधिक त्वरक के अधिकतम क्लस्टर आकार के साथ शिक्षा, कंप्यूटर दृष्टि और सन्निहित बुद्धिमत्ता के क्षेत्र में उद्यम ग्राहकों के साथ बड़े पैमाने पर उत्पादन सत्यापन का अनुभव किया है, और अपाचे-2.0 प्रोटोकॉल का उपयोग करके खुला स्रोत है।

  • लूंगफोर्ज का पूर्ववर्ती AIAK-ट्रेनिंग-एलएलएम है, जो Baidu Baige द्वारा आंतरिक रूप से उपयोग किया जाने वाला दीर्घकालिक प्रशिक्षण त्वरण ढांचा है। इससे पहले कि यह आधिकारिक तौर पर खुला स्रोत था, यह पहले से ही कई उद्योगों में उद्यम ग्राहकों के बीच उत्पादन-स्तर के परीक्षणों का सामना कर चुका था - शैक्षिक परिदृश्यों में मॉडल प्रशिक्षण, कंप्यूटर दृष्टि में मल्टी-मोडल कार्य, और सन्निहित इंटेलिजेंस वीएलए (विजुअल-लैंग्वेज-एक्शन) मॉडल सभी लागू किए गए हैं। अप्रैल 2026 में, Baidu Baige ने इसे आधिकारिक तौर पर ओपन सोर्स करने का निर्णय लिया और इसे LoongForge नाम दिया, जो Baige Loong ओपन सोर्स श्रृंखला में शामिल हो गया, उसी श्रृंखला के LoongFlow (विशेषज्ञ AI एजेंटों के लिए एक सोच और सीखने की रूपरेखा) को प्रतिध्वनित करता है। "लूंगफोर्ज" नाम पारंपरिक चीनी ड्रैगन बोट से लिया गया है, जिसका अर्थ है लहरों को तोड़ने के लिए मिलकर काम करना। जुलाई 2026 तक, इसके GitHub रिपॉजिटरी में 150 से अधिक सितारे हैं और यह उच्च स्तर की सामुदायिक गतिविधि बनाए रखता है। टीम का इंजीनियरिंग ब्लॉग नियमित रूप से तकनीकी गहन लेखों को अपडेट करता है, जिसमें विषम समानांतर प्रशिक्षण, डीपी लोड संतुलन, वीएलए मॉडल त्वरण इत्यादि जैसे विषयों को शामिल किया गया है। सामग्री उच्च गुणवत्ता की है, जो दर्शाती है कि परियोजना टीम ने प्रौद्योगिकी में निवेश करना जारी रखा है।

  • लूंगफोर्ज की मुख्य स्थिति स्पष्ट है: एक ढांचा, चार मोड। इसकी वास्तुकला को तीन परतों में विभाजित किया गया है - मॉडल परत एकीकृत अमूर्तता के लिए ज़िम्मेदार है, सिस्टम परत एंड-टू-एंड अनुकूलन पर केंद्रित है, और हार्डवेयर परत क्रॉस-प्लेटफ़ॉर्म अनुकूलन को हल करती है। मॉडल परत पर, लूंगफोर्ज ने मेगेट्रॉन-एलएम के शीर्ष पर मॉडल एब्स्ट्रैक्शन की एक परत बनाई, मल्टी-मोडल मॉडल को तीन भागों में विघटित किया: अवधारणात्मक एन्कोडिंग परत (एनकोडर), जेनरेशन बैकबोन परत (फाउंडेशन), और संयुक्त शेड्यूलिंग परत। एक नए मॉडल तक पहुंचने के लिए, आपको केवल संबंधित घटकों को पंजीकृत करना होगा, और फिर अंतर्निहित कोड को फिर से लिखे बिना YAML कॉन्फ़िगरेशन फ़ाइल के माध्यम से मॉड्यूल स्प्लिसिंग और समानांतर रणनीति कॉन्फ़िगरेशन को पूरा करना होगा। वास्तविक परीक्षण में, LLaVA-OneVision के नए विज़ुअल एनकोडर RICE-ViT को अनुकूलित करने में टीम को केवल कुछ दिन लगे। कई हफ्तों के पारंपरिक समाधान के अनुकूलन चक्र की तुलना में, एक महत्वपूर्ण अंतर था। यदि आप Qwen3.5 की भाषा रीढ़ को DeepSeek V3 से बदलना चाहते हैं, तो आपको केवल YAML संदर्भ पथ को एक पंक्ति में बदलना होगा। पूरे गोदाम को फोर्क करने की कोई आवश्यकता नहीं है। सिस्टम स्तर पर अनुकूलन अधिक गहन है। एलएलएम बेस के लिए, लूंगफोर्ज सीसीटी गणना और ट्रांसमिशन समानता को लागू करता है, और लंबे अनुक्रम प्रशिक्षण में एमओई मॉडल की गणना, संचार और डेटा ट्रांसमिशन को समान रूप से व्यवस्थित करता है। मापा गया Qwen3-30B-A3B प्रशिक्षण प्रदर्शन 32K अनुक्रम लंबाई के तहत 16% बढ़ गया। चंकपाइप पाइपलाइन समानता अल्ट्रा-लॉन्ग अनुक्रमों की मेमोरी बाधा को हल करती है, जिससे लाखों संदर्भ विंडो छोटे और मध्यम आकार के समूहों पर चलने की अनुमति मिलती है। डीपसीक वी3.2 के डीएसए विरल ध्यान आर्किटेक्चर के लिए, लूंगफोर्ज ने संपूर्ण ध्यान गणना लिंक पर गहन ऑपरेटर फ़्यूज़न और अनुकूलन किया है, जिससे एंड-टू-एंड प्रदर्शन में लगभग 5 गुना सुधार हुआ है। मल्टी-मोडल अनुकूलन पक्ष पर, डीपी लोड संतुलन तंत्र विशेष रूप से महत्वपूर्ण है। जब पारंपरिक डेटा समानता अत्यंत असमान लंबाई (एक तस्वीर के लिए लगभग 256 टोकन, और 20 मिनट के वीडियो के लिए 100,000 से अधिक टोकन) के साथ मल्टी-मोडल डेटा का सामना करती है, तो अनुक्रम लंबाई के द्विघात भिन्नता के कारण प्रत्येक जीपीयू की वास्तविक गणना राशि बहुत अलग हो जाएगी, एक तेज़ कार्ड और एक धीमे कार्ड के साथ। लूंगफोर्ज प्रत्येक पुनरावृत्ति से पहले नमूना आवंटन को गतिशील रूप से पुनर्व्यवस्थित करता है, जिससे रैंकों के बीच लोड अंतर काफी कम हो जाता है। यह 5000+ काकुनलुन P800 क्लस्टर पर 90%+ रैखिक विस्तार दक्षता प्राप्त करने के लिए एक महत्वपूर्ण समर्थन भी है।मॉडल विषम समानता विज़न ट्रांसफार्मर और एलएलएम के बीच पैरामीटर स्केल में सैकड़ों गुना अंतर के कारण होने वाली दक्षता समस्या को हल करती है, जिससे उन्हें स्वतंत्र रूप से इष्टतम समानांतर रणनीतियों को कॉन्फ़िगर करने की अनुमति मिलती है। 32K अनुक्रम के तहत सामुदायिक समाधान की तुलना में Qwen3-VL-30B का मापा थ्रूपुट 45% बढ़ गया। हार्डवेयर परत का प्लग-इन डिज़ाइन LoongForge का एक अलग लाभ है। GPU पक्ष मूल रूप से PyTorch/CUDA के माध्यम से मेगेट्रॉन से जुड़ता है, और XPU पक्ष अंतर्निहित इंटरफ़ेस अंतरों को समाहित करने के लिए XPU_Plugin प्लग-इन का उपयोग करता है। समान प्रशिक्षण कोड को NVIDIA GPU और कुनलुन XPU के बीच निर्बाध रूप से स्विच करने के लिए केवल एक पर्यावरण चर को बदलने की आवश्यकता है। उन टीमों के लिए जिन्हें हार्डवेयर परिनियोजन में प्रशिक्षण की आवश्यकता होती है, इसका मतलब है कि कोड के दो सेट बनाए रखने की आवश्यकता नहीं है, और बदलते हार्डवेयर के कारण वितरित तर्क को फिर से लिखने की आवश्यकता नहीं है। उपयोगकर्ता अनुभव के संदर्भ में, LoongForge मेगेट्रॉन उपयोगकर्ताओं की आदतों को जारी रखता है। बुनियादी प्रशिक्षण पैरामीटर मेगेट्रॉन के साथ संगत हैं, और पाइपलाइन और डेटा समानांतर कॉन्फ़िगरेशन शैलियाँ समान हैं। घटक-स्तरीय स्वतंत्र कॉन्फ़िगरेशन (जैसे विज़ुअल एनकोडर और भाषा बैकबोन के लिए विभिन्न टीपी आकारों का उपयोग करना) को हाइड्रा के माध्यम से कार्यान्वित किया जाता है, जिसे शुरू करने के लिए वितरित प्रशिक्षण में कुछ अनुभव वाली टीमों के लिए बहुत मुश्किल नहीं होना चाहिए। डेटा प्रीप्रोसेसिंग टूलचेन और हगिंगफेस वेट के ऑफ़लाइन रूपांतरण के लिए टूल भी इसमें बनाए गए हैं। वर्तमान संस्करण (v0.1.0, मई 2026 में जारी) 20+ मॉडल परिवारों का समर्थन करता है, जिसमें डीपसीक (वी2/वी3/वी3.2/वी4), क्वेन (पूर्ण श्रृंखला 0.6बी-480बी), एलएलएएमए

  • LoongForge Apache-2.0 प्रोटोकॉल का उपयोग करके खुला स्रोत है। स्रोत कोड मुफ़्त और उपलब्ध है। सामुदायिक संस्करण और एंटरप्राइज़ संस्करण के बीच कोई अनुमति अंतर नहीं है। एक प्रशिक्षण बुनियादी ढांचे के रूप में, इसका व्यावसायीकरण पथ सीधे सॉफ्टवेयर लाइसेंस बेचना नहीं है, बल्कि Baidu Baige के कंप्यूटिंग पावर प्लेटफॉर्म पर LoongForge का उपयोग करने के लिए अधिक टीमों को आकर्षित करना है, जिससे Baidu स्मार्ट क्लाउड की कंप्यूटिंग पावर रेंटल और AI प्लेटफॉर्म सेवाओं की मांग बढ़ रही है। यह पिछले ओपन सोर्स एआई फ्रेमवर्क के सामान्य बिजनेस मॉडल के अनुरूप है - फ्रेमवर्क स्वयं मुफ़्त है, और क्षमताएं जितनी मजबूत होंगी और पारिस्थितिकी तंत्र जितना बड़ा होगा, अपस्ट्रीम कंप्यूटिंग सेवाओं के लिए खिंचाव उतना ही मजबूत होगा। XPU_Plugin के डिज़ाइन के लिए धन्यवाद, Baidu कुनलुन कोर पर LoongForge चलाने वाले उपयोगकर्ताओं को अतिरिक्त अनुकूलन करने की आवश्यकता नहीं है, और NVIDIA GPU का उपयोग करने वाले उपयोगकर्ता प्रभावित नहीं होते हैं। लक्षित उपयोगकर्ता अपेक्षाकृत स्पष्ट हैं: पूर्व-प्रशिक्षण या बड़े पैमाने पर फाइन-ट्यूनिंग करने वाली टीमें, विशेष रूप से वे जिन्हें एक ही समय में भाषा, दृश्य-भाषाई, प्रसार और रोबोटिक्स के लिए चार अलग-अलग प्रशिक्षण स्टैक बनाए रखने के लिए मजबूर किया गया है। एकल-जीपीयू उपयोगकर्ताओं या केवल अनुमान लगाने वाली टीमों के लिए इसकी बहुत कम अपील है - यह क्लस्टर-स्केल टूल की खासियत है।

  • लूंगफोर्ज को आधिकारिक तौर पर खुला स्रोत बने हुए लगभग तीन महीने हो गए हैं, और सामुदायिक प्रतिक्रिया अभी भी संचय के प्रारंभिक चरण में है। GitHub मुद्दों और इंजीनियरिंग ब्लॉगों पर बातचीत से देखते हुए, तकनीकी समुदाय की प्रतिक्रिया आम तौर पर सकारात्मक है। सकारात्मक टिप्पणियाँ कई पहलुओं पर ध्यान केंद्रित करती हैं: सबसे पहले, "सभी मोड को कवर करने वाले एक ढांचे" की स्थिति वास्तविक समस्या बिंदु पर प्रहार करती है। कुछ उपयोगकर्ता टिप्पणियों में उल्लेख किया गया है कि "आखिरकार मेगेट्रॉन, लेरोबोट और डिफ्यूजन फ्रेमवर्क के बीच आगे और पीछे स्विच करने की कोई आवश्यकता नहीं है"; दूसरा, प्रदर्शन डेटा अपेक्षाकृत ठोस है, और तृतीय-पक्ष मूल्यांकन साइट besthub.dev के एक स्वतंत्र विश्लेषण लेख ने डीएसए मॉडल पर इसके 5 गुना से अधिक त्वरण प्रदर्शन को मान्यता दी है; तीसरा, दोहरे हार्डवेयर बैकएंड के अलग-अलग फायदे स्पष्ट हैं, और अक्सर सामुदायिक तुलना लेखों में इसे लूंगफोर्ज के रूप में माना जाता है। मेगेट्रॉन-एलएम और डीपस्पीड के बीच मुख्य अंतर - बाद वाले दो के पास कुनलुन कोर पर कोई मूल समर्थन नहीं है। नकारात्मक टिप्पणियाँ और विवादास्पद बिंदु भी ध्यान देने योग्य हैं: सबसे पहले, रूपरेखा अभी भी प्रारंभिक चरण (v0.1.0) में है, और कुछ कार्य (जैसे चेकपॉइंट प्रारूप रूपांतरण की स्थिरता) अभी भी निरंतर पुनरावृत्ति के अधीन हैं; दूसरा, स्थापना और परिनियोजन सीमा अधिक है, और यह वर्तमान में डॉकर छवियों या स्रोत कोड संकलन पर निर्भर है, जिसके लिए कुछ इंजीनियरिंग कॉन्फ़िगरेशन अनुभव की आवश्यकता होती है; तीसरा, परियोजना में वर्तमान में केवल 150 से अधिक सितारे हैं, जो मेगेट्रॉन-एलएम की परिपक्वता से बहुत पीछे है, और सामुदायिक योगदान पारिस्थितिकी तंत्र ने अभी तक कोई पैमाना नहीं बनाया है। कुछ उपयोगकर्ताओं ने यह भी बताया कि दस्तावेज़ में और सुधार की आवश्यकता है, विशेष रूप से दस्तावेज़ के चीनी संस्करण के कुछ अध्यायों में अभी भी अनुवाद के निशान हैं।

  • एआई प्रशिक्षण ढांचा ट्रैक जहां लूंगफोर्ज स्थित है, ने अब कई स्पष्ट परतें बना ली हैं। एलएलएम प्रशिक्षण के क्षेत्र में, एनवीआईडीआईए के मेगेट्रॉन-एलएम और माइक्रोसॉफ्ट के डीपस्पीड वास्तव में उद्योग मानक हैं। पहले को बड़े पैमाने पर वितरित प्रशिक्षण के प्रदर्शन के लिए व्यापक रूप से अपनाया गया है, और बाद वाले को ज़ीरो अनुकूलन श्रृंखला के लिए जाना जाता है। इन दो रूपरेखाओं के अलावा, एलएलएएमए-फैक्ट्री, फाइन-ट्यूनिंग परिदृश्यों के लिए एक्सोलोटल और हगिंग फेस इकोसिस्टम के ट्रांसफार्मर भी हैं। लूंगफोर्ज की विशिष्टता यह है कि यह एक शुद्ध एलएलएम प्रशिक्षण ढांचा नहीं है, बल्कि एक "एकत्रीकरण" ढांचा है जो कई तौर-तरीकों को जोड़ने का प्रयास करता है। यह एलएलएम बेस के रूप में मेगेट्रॉन-एलएम की समानांतर रणनीति को विरासत में मिला है, वीएलएम विज़ुअल घटक डिकॉउलिंग और वीएलए सन्निहित मॉडल समर्थन को पूरक करता है जो आम तौर पर एलएलएम ढांचे में गायब हैं, और प्रसार मॉडल के साथ पिछड़ा संगत है। उद्योग मीडिया 36kr और कई प्रौद्योगिकी स्व-मीडिया रिपोर्टें आम तौर पर मानती हैं कि यह स्थिति "व्यावहारिक" है - यह किसी को प्रतिस्थापित करने का दावा नहीं करती है, बल्कि मेगेट्रॉन-एलएम जैसे मल्टी-मोडल परिदृश्यों में अंतराल को भरने का दावा करती है। यह ध्यान देने योग्य है कि लूंगफोर्ज घरेलू चिप पारिस्थितिकी तंत्र में एक अद्वितीय स्थान रखता है। वर्तमान में, मुख्यधारा के ओपन सोर्स प्रशिक्षण ढांचे में आम तौर पर घरेलू चिप्स के लिए कमजोर समर्थन होता है, और लूंगफोर्ज का मूल कुनलुन एक्सपीयू समर्थन इसे घरेलू कंप्यूटिंग पावर परिदृश्यों में लगभग प्रत्यक्ष प्रतिस्पर्धा के बिना बनाता है। इस लाभ को और बढ़ाया जा सकता है क्योंकि बड़े मॉडल प्रशिक्षण में घरेलू चिप्स का अनुपात लगातार बढ़ रहा है।

  • इस स्तर पर लूंगफोर्ज के साथ मुख्य जोखिम इसकी परिपक्वता से उत्पन्न होता है। V0.1.0 संस्करण अभी भी एक प्रारंभिक रिलीज़ है, और तैनाती के दौरान कुछ उपयोगकर्ताओं द्वारा सामना की गई पर्यावरण कॉन्फ़िगरेशन समस्याओं को अभी तक पूरी तरह से पचाया नहीं गया है। GitHub पर मेगेट्रॉन-एलएम के हजारों सितारों और सामुदायिक योगदानकर्ताओं के विशाल पैमाने की तुलना में, LoongForge की सामुदायिक पारिस्थितिकी परिपक्व होने से बहुत दूर है, और दीर्घकालिक रखरखाव और विकास Baidu Baige टीम के निरंतर निवेश पर अत्यधिक निर्भर है। यदि Baidu की आंतरिक रणनीतिक प्राथमिकताएँ बदलती हैं, तो ढांचे की पुनरावृत्ति लय प्रभावित हो सकती है। तकनीकी स्तर पर, हालांकि लूंगफोर्ज के सन्निहित मॉडल प्रशिक्षण उपप्रणाली में एक स्पष्ट डिजाइन विचार है, सन्निहित खुफिया क्षेत्र की परिपक्वता अभी भी तेजी से विकसित हो रही है, और मुख्यधारा के नीति मॉडल के लिए मानक अभी तक नहीं बने हैं, जिसका अर्थ है कि सन्निहित दिशा में ढांचे की अनुकूलता को निरंतर पुनरावृत्तियों के दबाव का सामना करना पड़ सकता है। इसके अलावा, क्या कुनलुन एक्सपीयू के ढांचे की अनुकूलन गहराई में विशिष्ट हार्डवेयर पर अंतर्निहित निर्भरता है, और क्या इस अनुकूलन को Baidu की आंतरिक कंप्यूटिंग शक्ति पर भरोसा किए बिना कम लागत पर बाहरी टीम द्वारा पुन: पेश किया जा सकता है, यह भी निरंतर ध्यान देने योग्य मुद्दे हैं।

  • टीम प्रोफ़ाइल जिसके लिए LoongForge सबसे उपयुक्त है: जो लोग कई तौर-तरीकों (एलएलएम + वीएलएम या एलएलएम + प्रसार या अधिक जटिल संयोजनों) का उपयोग करके बड़े पैमाने पर मॉडल पूर्व-प्रशिक्षण या बड़े पैमाने पर फाइन-ट्यूनिंग कर रहे हैं, उन्होंने महसूस किया है कि प्रशिक्षण ढांचे के कई सेटों को बनाए रखने की लागत बढ़ रही है, और दो हार्डवेयर प्लेटफार्मों के बीच लचीले ढंग से स्विच करने की क्षमता बनाए रखना चाहते हैं। उन टीमों के लिए जो फाइन-ट्यूनिंग के लिए केवल सादे पाठ एलएलएम का उपयोग करते हैं, सीधे एलएलएएमए-फैक्ट्री या हगिंग फेस ट्रेनर का उपयोग करना अधिक हल्का और कुशल हो सकता है। यदि कोई टीम पूरी तरह से NVIDIA GPU पर निर्भर है और उसे सन्निहित मॉडल प्रशिक्षण की आवश्यकता नहीं है, तो मेगेट्रॉन-एलएम या डीपस्पीड का वर्तमान संस्करण एक सुरक्षित विकल्प बना हुआ है।

  • लूंगफोर्ज स्पष्ट स्थिति और व्यावहारिक डिजाइन के साथ एक पूर्ण-मोडल प्रशिक्षण ढांचा है। इसने मल्टी-मॉडल प्रशिक्षण परियोजनाओं की जटिलता को कम करने और घरेलू चिप पारिस्थितिकी तंत्र को खोलने में विशिष्ट मूल्य बनाया है। यह एक ऐसा ढांचा नहीं है जो "दुनिया को जीतने" की कोशिश करता है, बल्कि मल्टी-मॉडल परिदृश्यों में मौजूदा प्रौद्योगिकी स्टैक में अंतराल को भरने के लिए है। यदि टीमें पहले से ही मल्टी-मॉडल प्रशिक्षण में इंजीनियरिंग लागत का दबाव महसूस कर रही हैं, तो इस परियोजना पर नज़र रखने लायक है। ओपन सोर्स समुदाय से सकारात्मक प्रतिक्रिया और निरंतर संस्करण पुनरावृत्ति इस बात में महत्वपूर्ण चर होंगे कि क्या यह वास्तव में औद्योगिक स्तर के समाधान के रूप में विकसित हो सकता है।

उपयोगकर्ता समीक्षाएं

  • अवतार
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • अवतार
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • अवतार
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • अवतार
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • अवतार
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • अवतार
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • अवतार
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • अवतार
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • अवतार
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • अवतार
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • अवतार
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • अवतार
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • अवतार
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • अवतार
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • अवतार
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • अवतार
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • अवतार
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • अवतार
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • अवतार
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • अवतार
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • अवतार
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • अवतार
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • अवतार
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • अवतार
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • अवतार
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • अवतार
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • अवतार
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • अवतार
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • अवतार
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • अवतार
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。