蚂蚁百灵发布Ling-3.0-flash:124B参数干翻1T旗舰,还开源免费

小模型撬动大智能

2026-07-26 13:24

7月24日,蚂蚁集团旗下百灵大模型发布了新一代原生混合推理模型——Ling-3.0-flash。它的参数规格让人眼前一亮:总参数量124B,激活参数量仅5.1B,但在推理、指令遵循和长文本能力上,全面对标甚至超越了上一代1T级旗舰Ring-2.6-1T。

用不到八分之一的参数量,跑出1T模型的效果。这不是简单的小模型优化,而是架构层面的范式切换。

先说技术内核。Ling-3.0-flash从预训练阶段就采用了原生混合线性注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层。通俗讲,以前的自注意力机制计算量随文本长度平方级增长——输入1024个token要算1024×1024次。现在压到了线性级别,长文本输入的首字响应延迟降低了60%至80%以上。处理一份100页的PDF,传统模型可能要等5秒才出第一个字,Ling-3.0-flash不到1秒就能开始输出。

更狠的是稀疏度。Ling-3.0-flash把专家激活比例从前代的1/32进一步压缩到1/64。这意味着模型有64个专家子网络,每次推理只激活最擅长的那个,其余63个专家待命但不耗电。124B参数「摆在桌面」,但每次干活只花5.1B的力气——这才是激活参数只有总参4%的秘密。

围绕真实生产力场景,Ling-3.0-flash扩展了超过1万个可交互训练环境,在代码编写、复杂任务拆解、多源信息调研等Agent场景实现了全程自主闭环。它解决了传统模型在长程任务中容易「跑偏」或断档的问题,在Agent落地方向上迈出了实质性的一步

响应速度方面,Ling-3.0-flash接入了SGLang HiCache与Mooncake分级缓存架构,实现了物理双池、集群共享L3缓存,让长程交互不需要重复计算。这带来的效果很直接:长输入下的首字响应延迟相比前代降低了60%到80%以上。

在发布策略上,蚂蚁选择了相当开放的做法。即日起到8月3日23:00,用户可以通过OpenRouter与百灵官方平台免费调用API。免费期结束后,模型权重将正式开源。这意味着一款在多项评测中能打的小模型,将成为所有人都能使用的公共基础设施。

把视线拉远一点看,Ling-3.0-flash的价值可能不只在技术参数上。过去一年行业的叙事是「越大越强」,从千亿到万亿参数一路狂飙。蚂蚁百灵的这条路线给出了另一种可能:智能密度比参数规模更重要。5.1B激活参数做到了对标1T,这种效率杠杆的性价比,对于需要自建Agent的中小团队来说尤为实用。当模型不再是算力的无底洞时,真正的创新门槛才会降下来。