月之暗面开源全球最大模型Kimi K3:2.8万亿参数,人民日报头版

开源首次登顶编码榜

2026-07-29 07:20

全球参数最大的开源AI模型,不在硅谷,在北京。

7月27日,月之暗面正式发布了Kimi K3的模型权重和技术报告,向全球开源。Kimi K3总参数达2.8万亿,原生支持视觉理解,具备100万词元的上下文窗口。在大模型编码评估系统Frontend Code Arena上,它以1679分拿下第一,超过了Claude Fable 5和GPT-5.6 Sol等闭源模型——这是开源模型首次在该榜单登顶并反超自家旗舰。

人民日报7月29日在头版刊发长文解读这一成就,这样的规格在科技报道里并不多见。文章核心讲了两个技术突破,值得拆开来看。

第一个是KDA混合线性注意力机制。传统Transformer注意力机制在处理长文本时,计算量随文本长度接近平方级增长——模型多读一倍内容,计算量就要翻四倍,这是超长文本始终难以落地的根本瓶颈。KDA通过混合线性设计把计算量降到接近线性增长。通俗说就是,以前读长文像爬楼梯越爬越慢,现在变成了平地走路速度不变。

第二个是注意力残差技术。模型越大、层数越深,信号在层层传递过程中越容易衰减失真,训练也越容易失败——这是全球大模型工程通用的难题。注意力残差相当于给巨型模型装了一台信号放大器,让2.8万亿参数能稳定跑起来。

这两个技术放在一起看,其实揭示了一个重要趋势:中国大模型的竞争力,正在从纯参数堆量走向底层架构创新。

数据也很能说明问题。OpenRouter统计显示,7月20日至26日,中国大模型周调用量达33万亿词元,连续13周全球第一。高盛分析认为,中国开源模型正在到达面向全球扩散的关键临界点,预计2026年下半年可能出现更多总参数2万亿至5万亿的模型。

但这里有一个更值得关注的维度。Kimi K3在编码评测上超过闭源模型这个事实,坦白讲比参数规模和调用量都更有信号意义。编码是AI能力的基础设施层——如果你连代码都能写好,就能借助自己的输出辅助开发更强、更智能的下一代模型,形成自我强化的正循环。

月之暗面CEO杨植麟在解读中提到的「从单个智能体到智能体集群」也值得咂摸。参数的堆叠只是量的积累,参数之间的交互方式才是质的跳变。当一个模型集群能够自主分工、协同完成复杂任务时,参数总量就不再是数字游戏,而是能力的实际放大器。

当然,2.8万亿参数的开源也把一个问题摆上了台面:开源和安全的边界在哪里?上个月硅谷正因为「是否该禁止开源前沿模型」吵得不可开交,Kimi K3的发布直接把这个议题推到了新高度——当开源模型的性能追平闭源,安全管制究竟该管什么、怎么管,再也没有模糊空间了。