Kimi学会了「自己干活」:中国大模型坐到了全球AI牌局主桌

月之暗面K3大模型开启Agent能力新范式

2026-07-30 07:05
Kimi学会了「自己干活」:中国大模型坐到了全球AI牌局主桌
Kimi学会了「自己干活」:中国大模型坐到了全球AI牌局主桌

月之暗面(Kimi)两周前扔出的K3大模型,正在改变全球AI行业对中国大模型的认知。瑞银分析师将其称为「第二个DeepSeek时刻」。但这一次,叙事逻辑完全不同——K3带来的不再是「更便宜的模型」,而是「会自己干活的模型」。

过去两年,中国大模型的竞赛主线很简单:用更低成本训练出逼近GPT-4性能的模型。DeepSeek的嶛起证明了这条路走得通,但它也将行业推入了一场「烧钱换参数、堆卡换性能」的消耗战。一个无法回避的事实是,纯粹的模型性能比拼正在陷入边际效益递减——用户不关心各家模型的分数和排名,只关心程序能不能跑通、结果是否可靠。

Agent能力的跃迁,恰好打破了这一僵局。Kimi K3的独到之处在于,它不再是「一问一答」的聊天工具,而是像一名人类分析师那样,规划任务、检索信息、调用工具、并行协作、交付成果。据月之暗面官方披露,K3在生成一个AI ASIC行业研究网站时,经历了120轮以上递归改进,完成2800次以上网页搜索与抓取1100次以上终端数据调用,处理超过1.1万页内容,覆盖87份季度报告和99份原始PDF。

这些任务已不再是传统意义上的一次问答,而是由检索、执行、校验、绘图和修改组成的长链路流程。支撑这种长程执行能力的,是一套完整Agent基础设施的重新设计。据技术报告披露,K3训练和评估期间共创建了超过5100万个沙箱,使长任务可以在等待模型推理时暂停释放资源,在模型生成下一步动作后快速恢复。这相当于把一次几分钟的回答,拉长成一条可持续数小时的执行链。

模型能力的跃迁也反映在硬性评测中。K3在Program Bench中得分77.8,超过GPT-5.6 Sol的77.6;在FrontierSWE中得分81.2,较GPT-5.6 Sol和Claude Opus 4.8分别高出9.9和14.5。有工程师在社交平台上称,在智能体工作流中,K3的表现接近Claude Fable 5,但成本显著降低。

真正值得关注的是,Kimi走出了一条与国内同行截然不同的商业化路径。与智谱AI、百度文心等以B端企业服务为主的厂商不同,Kimi自诞生起就选择直面C端用户。这条路曾备受质疑——C端用户付费意愿低、获客成本高,此前并无成功案例。但Kimi的坚持在2025年下半年开始显现回报。公司海外收入已超过国内收入,全球付费用户在K2.5发布后实现4倍增长。在第三方平台OpenRouter上,K2.5排名已升至第三位,仅次于Claude Sonnet 4.5和Gemini 3 Flash。

K3的API定价也印证了这种自信:缓存命中输入0.30美元/百万Token、未命中输入3.00美元/百万Token、输出15.00美元/百万Token,输出价格已与GPT-5.6 Terra相当。瑞银证券分析师指出,K3定价在国产模型的高端位置,恰恰说明真正好的模型能力有溢价权。

往后看,Kimi的路径选择正在影响整个行业对「中国大模型能做什么」的认知边界。2026年1月,英伟达CEO黄仁勋在CES主题演讲中,用Kimi K2 Thinking取代DeepSeek-R1作为演示Rubin NVL72系统的案例,这一细节被市场解读为中国大模型话语权的提升。据瑞银调研,目前中国头部模型训练成本约为海外领先模型的十分之一,API价格通常只有海外同类模型的10%至20%,同时国内模型厂商API业务仍能保持20%至40%的毛利率。

不过竞争远未到终局。月之暗面创始人杨植麟坦言,Agent集群的规模化训练在技术上仍有挑战。如何在C端持续扩大付费用户规模、在B端创造更稳固的企业收入、在全球化进程中应对地缘政治与合规风险,仍是未解之题。但至少,在这个由Agent重新定义应用范式的时代,来自中国的创新者已经坐上了牌桌——不再只是旁观者。