螞蟻百靈釋出Ling-3.0-flash:124B引數幹翻1T旗艦,還開源免費
小模型撬動大智慧
7月24日,螞蟻集團旗下百靈大模型釋出了新一代原生混合推理模型——Ling-3.0-flash。它的引數規格讓人眼前一亮:總引數量124B,啟用引數量僅5.1B,但在推理、指令遵循和長文字能力上,全面對標甚至超越了上一代1T級旗艦Ring-2.6-1T。
用不到八分之一的引數量,跑出1T模型的效果。這不是簡單的小模型最佳化,而是架構層面的正規化切換。
先說技術核心。Ling-3.0-flash從預訓練階段就採用了原生混合線性注意力架構,以5:1的比例交替堆疊KDA線性注意力層與MLA層。通俗講,以前的自注意力機制計算量隨文字長度平方級增長——輸入1024個token要算1024×1024次。現在壓到了線性級別,長文字輸入的首字響應延遲降低了60%至80%以上。處理一份100頁的PDF,傳統模型可能要等5秒才出第一個字,Ling-3.0-flash不到1秒就能開始輸出。
更狠的是稀疏度。Ling-3.0-flash把專家啟用比例從前代的1/32進一步壓縮到1/64。這意味著模型有64個專家子網路,每次推理只啟用最擅長的那個,其餘63個專家待命但不耗電。124B引數「擺在桌面」,但每次幹活只花5.1B的力氣——這才是啟用引數只有總參4%的秘密。
圍繞真實生產力場景,Ling-3.0-flash擴充套件了超過1萬個可互動訓練環境,在程式碼編寫、複雜任務拆解、多源資訊調研等Agent場景實現了全程自主閉環。它解決了傳統模型在長程任務中容易「跑偏」或斷檔的問題,在Agent落地方向上邁出了實質性的一步。
響應速度方面,Ling-3.0-flash接入了SGLang HiCache與Mooncake分級快取架構,實現了物理雙池、叢集共享L3快取,讓長程互動不需要重複計算。這帶來的效果很直接:長輸入下的首字響應延遲相比前代降低了60%到80%以上。
在釋出策略上,螞蟻選擇了相當開放的做法。即日起到8月3日23:00,使用者可以透過OpenRouter與百靈官方平臺免費呼叫API。免費期結束後,模型權重將正式開源。這意味著一款在多項評測中能打的小模型,將成為所有人都能使用的公共基礎設施。
把視線拉遠一點看,Ling-3.0-flash的價值可能不只在技術引數上。過去一年行業的敘事是「越大越強」,從千億到萬億引數一路狂飆。螞蟻百靈的這條路線給出了另一種可能:智慧密度比引數規模更重要。5.1B啟用引數做到了對標1T,這種效率槓桿的價效比,對於需要自建Agent的中小團隊來說尤為實用。當模型不再是算力的無底洞時,真正的創新門檻才會降下來。