LoongForge

เฟรมเวิร์กฝึกโมเดลแบบทุกโหมดโอเพนซอร์สจาก Baidu Baige ครอบคลุมการฝึก LLM, VLM, โมเดลดิฟฟิวชัน และ AI เชิงกายภาพในเฟรมเวิร์กเดียว รองรับ NVIDIA GPU และ Kunlunxin XPU แบบเนทีฟ

รายงานเชิงลึก

  • LoongForge คือเฟรมเวิร์กการฝึกอบรมแบบโอเพ่นซอร์สเต็มรูปแบบอย่างเป็นทางการของ Baidu Baige เมื่อเร็วๆ นี้ ซึ่งพัฒนามาจากสแต็กเร่งความเร็วการฝึกอบรมภายใน AIAK-Training-LLM ใช้กรอบงานแบบรวมเพื่อครอบคลุมความต้องการการฝึกอบรมของสี่โหมด: โมเดลภาษาขนาดใหญ่ (LLM), โมเดลภาษาภาพ (VLM), โมเดลการแพร่กระจาย (การแพร่กระจาย) และสติปัญญาที่เป็นตัวเป็นตน (เป็นตัวเป็นตน) สามารถเร่งความเร็วการฝึกอบรมตั้งแต่ต้นทางถึงปลายทางได้ 15%–50% ในโมเดลกระแสหลัก และรองรับแพลตฟอร์มฮาร์ดแวร์คู่ NVIDIA GPU และ Kunlun XPU แบบเนทีฟ เฟรมเวิร์กดังกล่าวได้รับการตรวจสอบการผลิตในวงกว้างกับลูกค้าองค์กรในด้านการศึกษา คอมพิวเตอร์วิทัศน์ และระบบอัจฉริยะที่รวบรวมไว้ โดยมีขนาดคลัสเตอร์สูงสุดมากกว่า 5,000 ตัวเร่งความเร็ว และเป็นโอเพ่นซอร์สที่ใช้โปรโตคอล Apache-2.0

  • LoongForge รุ่นก่อนคือ AIAK-Training-LLM ซึ่งเป็นเฟรมเวิร์กการเร่งความเร็วการฝึกอบรมระยะยาวที่ Baidu Baige ใช้ภายใน ก่อนที่จะเป็นโอเพ่นซอร์สอย่างเป็นทางการ บริษัทได้ยืนหยัดต่อการทดสอบระดับการผลิตในกลุ่มลูกค้าองค์กรในหลายอุตสาหกรรม ไม่ว่าจะเป็นการฝึกอบรมโมเดลในสถานการณ์ทางการศึกษา งานหลายรูปแบบในการมองเห็นคอมพิวเตอร์ และโมเดล VLA (ภาษาภาพ-การกระทำ) ที่ผสานรวมเข้าด้วยกัน ล้วนถูกนำมาใช้แล้ว ในเดือนเมษายน ปี 2026 Baidu Baige ตัดสินใจเปิดซอร์สอย่างเป็นทางการและตั้งชื่อมันว่า LoongForge โดยเข้าร่วมในซีรีส์โอเพนซอร์ส Baige Loong ซึ่งสะท้อน LoongFlow (กรอบความคิดและการเรียนรู้สำหรับตัวแทน AI ผู้เชี่ยวชาญ) ของซีรีส์เดียวกัน ชื่อ "LoongForge" มาจากเรือมังกรของจีน ซึ่งหมายถึงการทำงานร่วมกันเพื่อทำลายคลื่น ณ เดือนกรกฎาคม 2026 พื้นที่เก็บข้อมูล GitHub มีมากกว่า 150 ดาวและรักษากิจกรรมชุมชนในระดับสูง บล็อกวิศวกรรมของทีมอัปเดตบทความเชิงลึกทางเทคนิคเป็นประจำ ครอบคลุมหัวข้อต่างๆ เช่น การฝึกอบรมแบบขนานที่แตกต่างกัน การปรับสมดุลโหลด DP การเร่งความเร็วโมเดล VLA ฯลฯ เนื้อหามีคุณภาพสูง ซึ่งบ่งชี้ว่าทีมงานโครงการยังคงลงทุนในเทคโนโลยีอย่างต่อเนื่อง

  • ตำแหน่งหลักของ LoongForge นั้นชัดเจน: หนึ่งเฟรมเวิร์ก, สี่โหมด สถาปัตยกรรมของมันแบ่งออกเป็นสามชั้น - เลเยอร์โมเดลมีหน้าที่รับผิดชอบในการรวมนามธรรม เลเยอร์ระบบมุ่งเน้นไปที่การเพิ่มประสิทธิภาพแบบ end-to-end และเลเยอร์ฮาร์ดแวร์ช่วยแก้ปัญหาการปรับข้ามแพลตฟอร์ม ที่เลเยอร์โมเดล LoongForge ได้สร้างเลเยอร์ของนามธรรมของโมเดลไว้ที่ด้านบนของ Megatron-LM โดยแบ่งโมเดลหลายรูปแบบออกเป็นสามส่วน ได้แก่ เลเยอร์การเข้ารหัสการรับรู้ (Encoder) เลเยอร์แกนหลักของการสร้าง (Foundation) และเลเยอร์การตั้งเวลาแบบรวม ในการเข้าถึงโมเดลใหม่ คุณเพียงแค่ต้องลงทะเบียนส่วนประกอบที่เกี่ยวข้อง จากนั้นจึงดำเนินการเชื่อมต่อโมดูลและกำหนดค่ากลยุทธ์แบบขนานให้เสร็จสมบูรณ์ผ่านไฟล์การกำหนดค่า YAML โดยไม่ต้องเขียนโค้ดพื้นฐานใหม่ ในการทดสอบจริง ทีมงานใช้เวลาเพียงไม่กี่วันในการปรับตัวเข้ารหัสภาพ RICE-ViT ใหม่ของ LLaVA-OneVision เมื่อเทียบกับวงจรการปรับตัวของโซลูชันแบบเดิมที่ใช้เวลาหลายสัปดาห์ มีช่องว่างที่สำคัญ หากคุณต้องการแทนที่แกนหลักภาษาของ Qwen3.5 ด้วย DeepSeek V3 คุณจะต้องเปลี่ยนเส้นทางอ้างอิง YAML ในบรรทัดเดียวเท่านั้น ไม่จำเป็นต้องแยกโกดังทั้งหมด การเพิ่มประสิทธิภาพในระดับระบบมีความเข้มข้นมากขึ้น สำหรับฐาน LLM นั้น LoongForge จะใช้การคำนวณ CCT และการส่งข้อมูลแบบคู่ขนาน และจัดระเบียบการคำนวณ การสื่อสาร และการส่งข้อมูลของแบบจำลอง MoE อย่างสม่ำเสมอในการฝึกแบบลำดับยาว ประสิทธิภาพการฝึก Qwen3-30B-A3B ที่วัดได้เพิ่มขึ้น 16% ภายใต้ความยาวลำดับ 32K ความขนานไปป์ไลน์ ChunkPipe แก้ปัญหาคอขวดของหน่วยความจำของลำดับที่ยาวเป็นพิเศษ ช่วยให้หน้าต่างบริบทนับล้านทำงานบนคลัสเตอร์ขนาดเล็กและขนาดกลาง สำหรับสถาปัตยกรรมความสนใจแบบกระจายของ DSA ของ DeepSeek V3.2 นั้น LoongForge ได้ดำเนินการผสมผสานตัวดำเนินการเชิงลึกและการเพิ่มประสิทธิภาพบนลิงก์การคำนวณความสนใจทั้งหมด ซึ่งปรับปรุงประสิทธิภาพตั้งแต่ต้นทางถึงปลายทางประมาณ 5 เท่า ในด้านการปรับให้เหมาะสมหลายรูปแบบ กลไกการปรับสมดุลโหลด DP มีความสำคัญอย่างยิ่ง เมื่อความเท่าเทียมของข้อมูลแบบดั้งเดิมพบกับข้อมูลหลายรูปแบบที่มีความยาวไม่เท่ากันอย่างมาก (ประมาณ 256 โทเค็นสำหรับภาพเดียว และมากกว่า 100,000 โทเค็นสำหรับวิดีโอ 20 นาที) ความแปรปรวนกำลังสองของความยาวลำดับจะทำให้จำนวนการคำนวณจริงของ GPU แต่ละตัวแตกต่างกันมาก โดยมีการ์ดเร็วและการ์ดช้า LoongForge จัดเรียงการจัดสรรตัวอย่างแบบไดนามิกใหม่ก่อนการวนซ้ำแต่ละครั้ง ช่วยลดช่องว่างระหว่างโหลดระหว่างอันดับให้แคบลงอย่างมาก นี่ยังเป็นการสนับสนุนหลักในการบรรลุประสิทธิภาพการขยายเชิงเส้น 90%+ บนคลัสเตอร์ Kakunlun P800 มากกว่า 5,000 คลัสเตอร์การขนานแบบต่างกันของโมเดลช่วยแก้ปัญหาด้านประสิทธิภาพที่เกิดจากความแตกต่างในระดับพารามิเตอร์ระหว่าง Vision Transformer และ LLM ที่แตกต่างกันหลายร้อยเท่า ทำให้สามารถกำหนดค่ากลยุทธ์แบบขนานที่เหมาะสมที่สุดได้อย่างอิสระ ปริมาณงานที่วัดได้ของ Qwen3-VL-30B เพิ่มขึ้น 45% เมื่อเทียบกับโซลูชันชุมชนภายใต้ลำดับ 32K การออกแบบปลั๊กอินของเลเยอร์ฮาร์ดแวร์เป็นข้อได้เปรียบที่แตกต่างของ LoongForge ฝั่ง GPU เชื่อมต่อกับ Megatron โดยกำเนิดผ่าน PyTorch/CUDA และฝั่ง XPU ใช้ปลั๊กอิน XPU_Plugin เพื่อสรุปความแตกต่างของอินเทอร์เฟซพื้นฐาน รหัสการฝึกอบรมเดียวกันจำเป็นต้องเปลี่ยนตัวแปรสภาพแวดล้อมเพียงตัวเดียวเพื่อสลับระหว่าง NVIDIA GPU และ Kunlun XPU ได้อย่างราบรื่น สำหรับทีมที่ต้องฝึกอบรมการใช้งานฮาร์ดแวร์ หมายความว่าไม่จำเป็นต้องรักษาโค้ดสองชุด และไม่จำเป็นต้องเขียนตรรกะแบบกระจายใหม่เนื่องจากการเปลี่ยนฮาร์ดแวร์ ในแง่ของประสบการณ์ผู้ใช้ LoongForge ยังคงรักษานิสัยของผู้ใช้ Megatron ต่อไป พารามิเตอร์การฝึกขั้นพื้นฐานเข้ากันได้กับ Megatron และรูปแบบการกำหนดค่าไปป์ไลน์และข้อมูลแบบขนานจะคล้ายกัน การกำหนดค่าอิสระระดับส่วนประกอบ (เช่น การใช้ขนาด TP ที่แตกต่างกันสำหรับตัวเข้ารหัสภาพและแกนหลักของภาษา) ถูกนำมาใช้ผ่าน Hydra ซึ่งไม่น่าจะยากเกินไปสำหรับทีมที่มีประสบการณ์ในการฝึกอบรมแบบกระจายในการเริ่มต้น ห่วงโซ่เครื่องมือการประมวลผลข้อมูลล่วงหน้าและเครื่องมือสำหรับการแปลงน้ำหนัก HuggingFace แบบออฟไลน์ก็ถูกสร้างขึ้นมาเช่นกัน เวอร์ชันปัจจุบัน (v0.1.0 เปิดตัวในเดือนพฤษภาคม 2569) รองรับตระกูลโมเดลมากกว่า 20 ตระกูล ครอบคลุม LLM กระแสหลัก เช่น DeepSeek (V2/V3/V3.2/V4), Qwen (ซีรีส์เต็ม 0.6B–480B), LLaMA (2/3/3.1), MiniMax, GLM; รองรับด้าน VLM Qwen2.5/3-VL, InternVL2.5/3.5, Kimi-K2.5/K2.6, ERNIE4.5-VL ฯลฯ โมเดลการแพร่กระจายรองรับ Wan2.1/2.2 และ Qwen-Image โมเดลที่รวบรวมครอบคลุม Pi0.5, GR00T N1.6/N1.7, X-VLA,

  • LoongForge เป็นโอเพ่นซอร์สที่ใช้โปรโตคอล Apache-2.0 ซอร์สโค้ดนั้นฟรีและพร้อมใช้งาน ไม่มีความแตกต่างในการอนุญาตระหว่างเวอร์ชันชุมชนและเวอร์ชันองค์กร ในฐานะโครงสร้างพื้นฐานการฝึกอบรม เส้นทางสู่เชิงพาณิชย์ไม่ใช่การขายลิขสิทธิ์ซอฟต์แวร์โดยตรง แต่เพื่อดึงดูดทีมให้ใช้ LoongForge บนแพลตฟอร์มพลังการประมวลผลของ Baidu Baige มากขึ้น ซึ่งผลักดันความต้องการการเช่าพลังการประมวลผลและบริการแพลตฟอร์ม AI ของ Baidu Smart Cloud ซึ่งสอดคล้องกับโมเดลธุรกิจทั่วไปของเฟรมเวิร์ก AI แบบโอเพ่นซอร์สก่อนหน้านี้ โดยตัวเฟรมเวิร์กเองนั้นไม่มีค่าใช้จ่าย และยิ่งความสามารถแข็งแกร่งขึ้นและยิ่งระบบนิเวศมีขนาดใหญ่ขึ้นเท่าใด การดึงบริการประมวลผลต้นน้ำก็จะยิ่งแข็งแกร่งขึ้นเท่านั้น ด้วยการออกแบบ XPU_Plugin ผู้ใช้ที่ใช้งาน LoongForge บน Baidu Kunlun core จึงไม่จำเป็นต้องทำการปรับเปลี่ยนเพิ่มเติม และผู้ใช้ที่ใช้ NVIDIA GPU จะไม่ได้รับผลกระทบ ผู้ใช้เป้าหมายค่อนข้างชัดเจน: ทีมที่ทำการฝึกอบรมล่วงหน้าหรือการปรับแต่งขนาดใหญ่ โดยเฉพาะอย่างยิ่งทีมที่ถูกบังคับให้รักษาชุดการฝึกอบรมที่แตกต่างกันสี่ชุดสำหรับภาษา ภาษาภาพ การแพร่กระจาย และหุ่นยนต์ในเวลาเดียวกัน ไม่ค่อยน่าสนใจสำหรับผู้ใช้ GPU เดี่ยวหรือทีมที่ทำเพียงการอนุมานเท่านั้น ซึ่งเป็นเรื่องปกติของเครื่องมือระดับคลัสเตอร์

  • เป็นเวลาประมาณสามเดือนแล้วนับตั้งแต่ LoongForge เป็นโอเพ่นซอร์สอย่างเป็นทางการ และผลตอบรับจากชุมชนยังอยู่ในช่วงเริ่มต้นของการสะสม เมื่อพิจารณาจากการโต้ตอบในปัญหา GitHub และบล็อกด้านวิศวกรรม โดยทั่วไปแล้ว ปฏิกิริยาจากชุมชนทางเทคนิคมักจะเป็นบวก ความคิดเห็นเชิงบวกมุ่งเน้นไปที่หลายแง่มุม ประการแรก การวางตำแหน่งของ "กรอบงานเดียวที่ครอบคลุมทุกโหมด" กระทบถึงจุดที่เป็นปัญหาจริง ความคิดเห็นของผู้ใช้บางส่วนกล่าวว่า "ในที่สุดก็ไม่จำเป็นต้องสลับไปมาระหว่าง Megatron, LeRobot และเฟรมเวิร์กการแพร่กระจาย"; ประการที่สอง ข้อมูลประสิทธิภาพค่อนข้างมั่นคง และบทความวิเคราะห์อิสระจากเว็บไซต์ประเมินผลบุคคลที่สาม besthub.dev ยอมรับถึงประสิทธิภาพการเร่งความเร็วมากกว่า 5 เท่าในโมเดล DSA ประการที่สาม ข้อได้เปรียบที่แตกต่างของแบ็กเอนด์ฮาร์ดแวร์คู่นั้นชัดเจน และมักถูกมองว่าเป็น LoongForge ในบทความเปรียบเทียบชุมชน ความแตกต่างหลักระหว่าง Megatron-LM และ DeepSpeed ​​คือ สองตัวหลังไม่มีการรองรับ Kunlun core แบบเนทีฟ ความคิดเห็นเชิงลบและประเด็นที่เป็นข้อขัดแย้งก็ควรค่าแก่การเอาใจใส่เช่นกัน ประการแรก กรอบงานยังอยู่ในช่วงเริ่มต้น (v0.1.0) และฟังก์ชันบางอย่าง (เช่น ความเสถียรของการแปลงรูปแบบจุดตรวจสอบ) ยังอยู่ภายใต้การทำซ้ำอย่างต่อเนื่อง ประการที่สอง เกณฑ์การติดตั้งและการปรับใช้อยู่ในระดับสูง และปัจจุบันต้องใช้อิมเมจ Docker หรือการคอมไพล์ซอร์สโค้ด ซึ่งต้องใช้ประสบการณ์การกำหนดค่าทางวิศวกรรมบางอย่าง ประการที่สาม ปัจจุบันโครงการนี้มีดาวฤกษ์มากกว่า 150 ดวงเท่านั้น ซึ่งยังช้ากว่าการเติบโตของ Megatron-LM และระบบนิเวศการมีส่วนร่วมของชุมชนยังไม่ได้สร้างขนาด ผู้ใช้บางรายยังรายงานว่าเอกสารจำเป็นต้องได้รับการปรับปรุงเพิ่มเติม โดยเฉพาะอย่างยิ่งเอกสารเวอร์ชันภาษาจีนบางบทยังคงมีร่องรอยการแปล

  • เส้นทางเฟรมเวิร์กการฝึกอบรม AI ที่ LoongForge ตั้งอยู่ตอนนี้ได้ก่อตัวเป็นชั้นที่ชัดเจนหลายชั้นแล้ว ในด้านการฝึกอบรม LLM นั้น Megatron-LM ของ NVIDIA และ DeepSpeed ​​​​ของ Microsoft ถือเป็นมาตรฐานอุตสาหกรรมโดยพฤตินัย แบบแรกได้รับการยอมรับอย่างกว้างขวางสำหรับประสิทธิภาพของการฝึกอบรมแบบกระจายขนาดใหญ่ และแบบหลังเป็นที่รู้จักจากซีรีส์การเพิ่มประสิทธิภาพ ZeRO นอกเหนือจากสองเฟรมเวิร์กนี้แล้ว ยังมี LLaMA-Factory, Axolotl สำหรับการปรับแต่งสถานการณ์ และระบบนิเวศ Transformers of the Hugging Face ความพิเศษของ LoongForge ก็คือ ไม่ใช่กรอบการฝึกอบรม LLM เพียงอย่างเดียว แต่เป็นกรอบงาน "การรวมกลุ่ม" ที่พยายามเชื่อมโยงรูปแบบต่างๆ เข้าด้วยกัน โดยสืบทอดกลยุทธ์แบบขนานของ Megatron-LM เป็นฐาน LLM เสริมการแยกองค์ประกอบภาพ VLM และการสนับสนุนโมเดลที่รวบรวม VLA ซึ่งโดยทั่วไปจะขาดหายไปในกรอบงาน LLM และสามารถใช้งานร่วมกับโมเดลการแพร่กระจายแบบย้อนหลังได้ สื่ออุตสาหกรรม 36kr และรายงานสื่อด้วยตนเองของเทคโนโลยีหลายรายการ โดยทั่วไปเชื่อว่าการวางตำแหน่งนี้ "เชิงปฏิบัติ" - ไม่ได้อ้างว่าจะแทนที่ใครก็ได้ แต่เพื่อเติมเต็มช่องว่างในสถานการณ์หลายรูปแบบ เช่น Megatron-LM เป็นที่น่าสังเกตว่า LoongForge ครองตำแหน่งที่ไม่เหมือนใครในระบบนิเวศชิปในประเทศ ในปัจจุบัน กรอบการฝึกอบรมโอเพ่นซอร์สกระแสหลักโดยทั่วไปมีการสนับสนุนชิปในประเทศที่อ่อนแอ และการรองรับ Kunlun XPU ดั้งเดิมของ LoongForge ทำให้แทบไม่มีการแข่งขันโดยตรงในสถานการณ์พลังการประมวลผลในประเทศ ข้อได้เปรียบนี้อาจได้รับการขยายเพิ่มเติมอีกเมื่อสัดส่วนของชิปในประเทศในการฝึกโมเดลขนาดใหญ่ยังคงเพิ่มขึ้นอย่างต่อเนื่อง

  • ความเสี่ยงหลักของ LoongForge ในขั้นตอนนี้เกิดจากการครบกำหนด เวอร์ชัน v0.1.0 ยังคงเป็นเวอร์ชันเริ่มต้น และปัญหาการกำหนดค่าสภาพแวดล้อมที่ผู้ใช้บางรายพบระหว่างการใช้งานยังไม่ได้รับการแก้ไขอย่างสมบูรณ์ เมื่อเปรียบเทียบกับดาวนับพันของ Megatron-LM บน GitHub และผู้ร่วมให้ข้อมูลในชุมชนจำนวนมาก ระบบนิเวศน์ของชุมชน LoongForge ยังห่างไกลจากความสมบูรณ์ และการบำรุงรักษาและการพัฒนาในระยะยาวยังขึ้นอยู่กับการลงทุนอย่างต่อเนื่องของทีมงาน Baidu Baige หากลำดับความสำคัญเชิงกลยุทธ์ภายในของ Baidu เปลี่ยนไป จังหวะการวนซ้ำของกรอบงานอาจได้รับผลกระทบ ในระดับเทคนิค แม้ว่าระบบย่อยการฝึกอบรมแบบจำลองที่รวบรวมไว้ของ LoongForge จะมีแนวคิดการออกแบบที่ชัดเจน แต่ความสมบูรณ์ของสนามข่าวกรองที่รวบรวมนั้นยังคงมีการพัฒนาอย่างรวดเร็ว และมาตรฐานสำหรับแบบจำลองนโยบายกระแสหลักยังไม่ได้ถูกสร้างขึ้น ซึ่งหมายความว่าความเข้ากันได้ของกรอบงานในทิศทางที่รวบรวมไว้อาจเผชิญกับแรงกดดันจากการวนซ้ำอย่างต่อเนื่อง นอกจากนี้ ไม่ว่าความลึกของการเพิ่มประสิทธิภาพของเฟรมเวิร์ก Kunlun XPU จะขึ้นอยู่กับฮาร์ดแวร์เฉพาะหรือไม่ และการเพิ่มประสิทธิภาพนี้สามารถทำซ้ำโดยทีมงานภายนอกด้วยต้นทุนที่ต่ำโดยไม่ต้องอาศัยพลังการประมวลผลภายในของ Baidu หรือไม่ ก็เป็นประเด็นที่ควรค่าแก่การเอาใจใส่อย่างต่อเนื่องเช่นกัน

  • โปรไฟล์ทีมที่ LoongForge เหมาะสมที่สุดสำหรับ: ผู้ที่กำลังทำโมเดลขนาดใหญ่ก่อนการฝึกอบรมหรือการปรับแต่งขนาดใหญ่ โดยใช้รูปแบบต่างๆ (LLM + VLM หรือ LLM + การแพร่กระจายหรือการผสมผสานที่ซับซ้อนมากขึ้น) รู้สึกว่าค่าใช้จ่ายในการบำรุงรักษาเฟรมเวิร์กการฝึกอบรมหลายชุดกำลังเพิ่มขึ้น และต้องการรักษาความสามารถในการสลับระหว่างแพลตฟอร์มฮาร์ดแวร์ทั้งสองอย่างยืดหยุ่น สำหรับทีมที่ใช้เฉพาะ LLM ข้อความธรรมดาในการปรับแต่งอย่างละเอียด การใช้ LLaMA-Factory หรือ Hugging Face's Trainer โดยตรงอาจมีน้ำหนักเบากว่าและมีประสิทธิภาพมากกว่า หากทีมอาศัย NVIDIA GPU เพียงอย่างเดียวและไม่ต้องการการฝึกอบรมโมเดลแบบรวม Megatron-LM หรือ DeepSpeed ​​​​เวอร์ชันปัจจุบันยังคงเป็นตัวเลือกที่ปลอดภัยกว่า

  • LoongForge เป็นเฟรมเวิร์กการฝึกอบรมแบบเต็มรูปแบบพร้อมตำแหน่งที่ชัดเจนและการออกแบบที่เน้นการปฏิบัติจริง ได้สร้างคุณค่าที่แตกต่างในการลดความซับซ้อนของโครงการฝึกอบรมหลายรูปแบบและเปิดระบบนิเวศชิปในประเทศ ไม่ใช่กรอบการทำงานที่พยายาม "พิชิตโลก" แต่เพื่อเติมเต็มช่องว่างในกลุ่มเทคโนโลยีที่มีอยู่ในสถานการณ์หลายรูปแบบ หากทีมรู้สึกถึงความกดดันด้านต้นทุนด้านวิศวกรรมในการฝึกอบรมหลายรูปแบบอยู่แล้ว โปรเจ็กต์นี้ก็คุ้มค่าที่จะจับตาดูต่อไป ผลตอบรับเชิงบวกจากชุมชนโอเพ่นซอร์สและการทำซ้ำเวอร์ชันอย่างต่อเนื่องจะเป็นตัวแปรสำคัญที่ทำให้สามารถเติบโตเป็นโซลูชันระดับอุตสาหกรรมได้อย่างแท้จริง

รีวิวจากผู้ใช้

  • อวาตาร์
    kqreqlob
    LoongForge 这个框架是真的猛,我们团队在昆仑芯 P800 上跑了 Qwen3-VL 的训练,实测比之前用 Megatron 快了将近 40%,直接省了快一半的卡时。

  • อวาตาร์
    DogeDadWalker
    终于不用在 Megatron、LeRobot 和扩散框架之间来回切换了,一个 LoongForge 全搞定,维护成本下降太多了。

  • อวาตาร์
    MiningMoleFoster
    昨天试了 LoongForge 的 Embodied 子系统,Pi0.5 训练比 OpenPI 快了 2.2 倍,具身模型这块确实没什么框架能做到这个程度。

  • อวาตาร์
    DomingoGonzález
    文档还是有些粗糙,中文文档的部分章节明显就是机器翻译的,读起来很别扭,希望后面能好好修一下。

  • อวาตาร์
    Stephen_Fisher2
    apt install 一下午没跑起来,最后还是靠 Docker 搞定的,安装门槛确实不低,对新手不太友好。

  • อวาตาร์
    Diana.StewartK
    换基座改一行 YAML 这个设计太香了,以前在 Megatron 里换主干要改好几层底层代码,现在真的一天搞定。

  • อวาตาร์
    bigrabbit734
    粗略跑了一下 DeepSeek V3.2,训练吞吐确实吊打 Megatron,但是说实话社区太小了,遇到问题 Issues 里问了三天没人回。

  • อวาตาร์
    StephenSmith_Pro601
    DP 负载均衡这个机制很细节,我们 256 卡跑 InternVL 的时候确实看到吞吐提升了 3% 左右,大集群效果应该更明显。

  • อวาตาร์
    VerbanShulga vasil
    LoongForge 加昆仑芯的组合,对于被 GPU 卡脖子又想做多模态训练的团队来说,简直是救命稻草。

  • อวาตาร์
    石飞
    CCT 算通传并行这个思路漂亮,我们 32K 序列训 Qwen3-MoE 的时候确实比之前少了将近 16% 的 wall time。

  • อวาตาร์
    Sean.Stewart520399
    v0.1.0 还是有不少坑的,checkpoint 转换偶尔会报错,而且训练中断恢复的时候不太稳定,刚开源可以理解吧。

  • อวาตาร์
    xLauraPáez_dev
    我比较关心的是有没有长期维护的承诺,毕竟百度之前的开源项目断更的也不少,LoongForge 希望能持续迭代下去。

  • อวาตาร์
    ZLong_889
    ChunkPipe 流水线并行很实用,之前 1M 长序列根本没法在小集群上跑,现在 8 卡就能搞定,对我们小团队太友好了。

  • อวาตาร์
    Betty.EvansSr567
    看了那篇异构并行的技术博客,编码器用 TP=1 解码器用 TP=4 这个方案确实聪明,ViT 通信开销直接降为 0。

  • อวาตาร์
    Timothy_WilsonJr
    同实验室的在训机器人策略模型,LoongForge 的 Embodied 子系统把 Pi0.5 的吞吐翻了一倍多,这数据摆在那没法黑。

  • อวาตาร์
    Cole397_r
    Apache 2.0 协议开源好评,不像某些框架搞个社区版和企业版割韭菜,商用改起来也放心。

  • อวาตาร์
    tinygoose585
    项目到现在才 150 多颗星,跟 Megatron 比还是差太大,而且社区基本都是百度的开发在回问题,外部贡献者太少。

  • อวาตาร์
    SGonzales
    如果不是要在昆仑芯上训,我觉得没必要上 LoongForge,纯 NVIDIA GPU 的话 Megatron 还是更稳。

  • อวาตาร์
    GregoryMartin_2020
    跑 GR00T N1.6 的 VLA 训练,训练周期直接砍半,56% 的加速太夸张了,之前用 LeRobot 要等两天才能出结果。

  • อวาตาร์
    xJesusGrant_dev
    自适应 FP8 在 Qwen3-VL 235B 上比全量 FP8 还快了 10%,这优化深度确实可以,不是那种换个皮就走的东西。

  • อวาตาร์
    Russell_Robinson369
    DL 负载均衡那个方案写得挺深的,知道能看懂的人在跑大规模集群时候体会更深吧,我们 64 卡效果就不错了。

  • อวาตาร์
    Jude665
    总的来说是个可用的框架,但如果只能选一个稳定版,我会再等几个小版本迭代再上生产环境。

  • อวาตาร์
    x_7kpq611
    有没有人试过在昆仑芯 P800 上跑 Wan2.2 的扩散训练?看了官方说加速 116%,我想知道实际复现的差距大不大。

  • อวาตาร์
    StephanieWalker_2023
    具身智能这块 LoongForge 确实打了差异化,其他框架都不怎么管 VLA 和 WAM 模型的训练加速,LoongForge 直接内置了一个子系统专门搞这个。

  • อวาตาร์
    KimberlyLee
    作为一个搞 infra 的,LoongForge 最吸引我的是 XPU_Plugin 的设计,换硬件不用重写分布式逻辑,这在国产芯片采购场景下太实用了。

  • อวาตาร์
    FrankLong
    测试了几天,发现 LoongForge 的 DSA 融合算子对 DeepSeek V3.2 的加速确实很猛,5 倍差距不是吹的。

  • อวาตาร์
    TSmith_88
    能不能把 Docker image 先做好推到 Docker Hub 上?每次源码编译太劝退了,我们团队好几个小伙伴都卡在环境配置上。

  • อวาตาร์
    Alan.Price007
    自从切了 LoongForge 之后,同时训 LLM 和 VLM 终于不用在两套配置之间反复横跳了,统一的 checkpoint 格式解放双手。

  • อวาตาร์
    DVasquez_2021
    搞不懂为什么非要自己做一套模型抽象层,直接基于 Megatron 加多模态支持不好吗?说实话更希望看到对现有生态的兼容,而不是又出一个新框架让人学。

  • อวาตาร์
    RHughes_7718
    虽然还在早期,但这个方向真的正确。多模态训练的基础设施太碎片化了,LoongForge 至少给了一条路。如果百度能坚持投入,两年后很有可能成为标配。