Kimi K3 开源版

月之暗面发布的全球最大开源大模型,2.8万亿参数,原生支持多模态和100万token超长上下文,编程能力登顶全球

深度报告

  • 2026 年 7 月 16 日,北京月之暗面科技有限公司发布了 Kimi K3,一款总参数规模达 2.8 万亿的开源大模型。这是目前全球参数最大的开源模型,在 Frontend Code Arena 前端编程榜单中以 1679 分登顶,超越 Claude Fable 5 和 GPT-5.6 Sol。K3 基于自研 KDA 混合线性注意力机制和注意力残差技术构建,原生支持视觉理解,拥有 100 万 token 上下文窗口,面向长程编程、知识工作、深度研究和多模态理解等复杂任务场景进行了专项优化。它在续航类编程和智能体任务上展现出前沿水平,但整体综合智能仍落后于最强的闭源模型。

  • 月之暗面(Moonshot AI)成立于 2023 年,总部位于北京,是阿里巴巴和香港投资管理有限公司(港投)被投的 AI 创业公司。创始人杨植麟此前是清华大学交叉信息研究院的助理教授,团队核心成员来自清华、北大等顶级高校和 Google、Meta 等科技公司。 Kimi K3 的研发历时一年多,是 Kimi K2(2025 年 7 月发布)的正式继任者。中间还发布了 K2.5、K2.6、K2.7 Code 等迭代版本。此次 K3 的发布不仅在参数规模上实现了质的飞跃——从 K2 的万亿级跃升至 2.8 万亿——更在底层架构上进行了三项关键创新:KDA 混合线性注意力机制(Kimi Delta Attention)、注意力残差技术(Attention Residuals)和 Moon Clip 二阶优化器。 值得注意的是,Kimi K3 的发布也引发了一场行业风波。美国白宫科技政策办公室主任迈克尔·克拉齐奥斯在社交媒体上指控月之暗面通过蒸馏 Anthropic 的 Fable 模型来开发 K3,并威胁使用制裁和实体清单。OpenAI 战略未来负责人迪恩·鲍尔也公开发帖抨击,称其为「减速主义力量」。月之暗面企业业务负责人黄震昕明确回应称,K3 性能跃升的核心来自底层原创架构创新,并非对现有模型的蒸馏复刻。多家权威媒体和 AI 研究学者也公开站台,指出指控缺乏技术依据。

  • Kimi K3 的核心能力集中在以下几个方向。首先是编程能力,这是它最被看好的领域。在 Frontend Code Arena 前端代码榜单上,K3 以 1679 分排名第一,超过 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。实际的编程体验分为两种场景:一种是通过 Kimi Code 终端工具使用,支持 /model 命令切换,适合长期持续编程任务;另一种是通过 Kimi API 调用,兼容 OpenAI SDK,定价为缓存命中每百万 token 0.3 美元、未命中输入 3 美元、输出 15 美元。 其次是长程任务处理能力。官方展示的案例包括连续 48 小时自主完成芯片设计和优化、约两小时复现计算天体物理领域的 I-Love-Q 普适关系。在极少人工监督的情况下,K3 可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。 第三是多模态理解能力。K3 原生支持图文多模态输入,不是外挂视觉编码器,而是真正的原生视觉理解。这意味着它可以同时处理文本、图像和视频输入。 API 有四种使用方式。通过 Kimi 移动端应用(iOS/Android/HarmonyOS)可以直接免费对话。桌面版 Kimi Work 3.1.0 以上版本提供工作场景支持。Kimi Code 终端工具面向程序员。Kimi API 平台则面向开发者和企业用户。官方还提供了 Kimi Enterprise 企业版,提供数据隐私保护和成员管理功能。 从实际用户体验来看,前端开发者和程序员普遍给出较高评价,认为 K3 在前端代码生成和 UI 还原上「理解设计意图准确」。但普通用户的反馈则两极分化——有人觉得它在复杂长文分析上确实更好,但也有人吐槽「日常对话感受不到巨大差别」。

  • Kimi K3 的 API 定价处于中国头部模型的高位——输出每百万 token 15 美元,约合人民币 100 元。上一代 K2.6 是 4 美元,涨了近 3 倍。国内同类模型智谱 GLM-5.2 的输出价是 4.4 美元。 不过官方给出的一个重要数据是:在编程场景下,缓存命中率可以超过 90%,因此实际支出远低于标价。缓存命中输入仅需 0.3 美元每百万 token。官方称,依赖 Mooncake 分离式推理架构的这套体系,使得 K3 在高频编程场景下具备很高的性价比。 月之暗面企业业务负责人黄震昕明确表示,开源模型和中国大模型不该被贴上低价标签。「我们做出了 SOTA 级模型,也能匹配合理的商业定价。」Artificial Analysis 的测算显示,Kimi K3 的单任务成本约为 0.94 美元,与 GPT-5.6 Sol 的 1.04 美元接近,并不像表面上看起来便宜很多。 消费者端,Kimi 免费版包含一定的 K3 额度,付费会员分为多个档位,最高 699 元/月。有用户反映一天内用掉了 20% 的额度,意味着重度使用者的成本不容忽视。 月之暗面称将坚持开源路线。完整模型权重于 2026 年 7 月 27 日前发布,采用修改版 MIT 许可证。对于有私有化部署和微调需求的企业客户来说,开源是高价值的选择。

  • 正面评价主要集中在三个方面。一是编程场景下体验极好,前端代码生成质量高,理解设计意图准确,Vercel 创始人 Guillermo Rauch 也做了实测验证。二是长文本和长任务处理能力突出,用户反馈将几十页文档丢进去做总结时,K3 能精准提炼关键信息,主动做减法,「开始有判断力了」。三是专业化场景(金融分析、合同审查、行业研究)中的自动化能力让人满意,有用户用它找出了合同中的隐藏自动续约条款。 负面评价也很明显。吐槽最集中的是响应速度慢——同类任务 Claude Fable 5 耗时 3.5 分钟,K3 需要 12 分钟。API 响应速度低于同类平均水平。其次是定价偏高,从 K2.6 到 K3,输出价格翻了近 3 倍。再次是「过度推理」的问题,部分用户反映 K3 在模糊意图下会自作主张扩展任务范围,增加返工成本。也有用户反馈,日常轻度场景下感受不到显著提升。

  • 行业媒体整体给予了高度评价。经济日报将其解读为中国大模型走向定价权的新节点。高盛研报认为,此前中国大模型主要靠性价比进入全球市场,未来可能凭借前沿能力进入全球开发者的核心工作流。摩根士丹利则关注到 Kimi K3 的 API 价格处于中国头部模型高位,认为较高定价对大模型市场格局具有积极意义。 技术社区的分歧较大。一部分开发者认为它是「开源模型在编程领域的转折点」,因为这是第一次有开源模型在前端代码竞赛中全面超越所有闭源模型。另一部分人则认为 Benchmark 归 Benchmark,实际使用中的「慢和贵」是绕不开的客观代价。也有业内专家指出,K3 的真实价值不只在 C 端体验,而在于它将作为基座模型赋能大量中小企业——模型权重开源后,国内大量公司不用从零训练大模型。 在资本市场方面,K3 发布后美国 AI 股票出现了一波下跌,反映了投资者对开源前沿模型可能冲击闭源定价能力的担忧。埃隆·马斯克在相关评测下两次留言「令人印象深刻」,并将 K3 列为 Grok 4.6 的重点对标目标。

  • 蒸馏指控是最主要的争议。美国白宫直接出面指控,但技术专家普遍认为这一指控站不住脚。美国 AI 技术专家内森·兰伯特公开撰文指出,认为中国 AI 实验室仅通过窃取知识产权就能做出优秀模型的人「是时候醒醒了」。OpenAI 战略未来负责人迪恩·鲍尔也在争议性帖子中承认 K3 性能无法依靠蒸馏实现。 技术风险方面,模型的推理速度偏慢是当前最突出的短板。对于需要快速响应的生产环境,K3 可能不是最优选择。此外模型存在「过度推理」倾向,容易在无明确指令的情况下主动扩展任务范围,这在需要严格边界控制的场景中构成风险。 合规和数据安全方面存在现实问题。Kimi 的托管服务中的数据在中国境内处理,对于有数据出境限制的海外用户来说是一个重要考量。尽管开源权重发布后可以在本地部署,但 2.8 万亿参数模型的部署门槛极高——官方推荐 64 个以上加速器的超节点配置,普通企业和个人基本无法负担。 模型幻觉问题也没有完全解决。黄震昕本人坦言「幻觉无法彻底根除」,但 K3 已大幅压低其发生率,并要求配套 Agent Swarm 架构中的事实校验员子 Agent 进行二次验证。

  • 适合使用 Kimi K3 的人群是:前端开发者和全栈工程师,尤其是从事复杂 UI 开发和前端工程化的团队;需要长时间自动化编程的 AI Agent 工程师和研究人员;金融分析师、行业研究员和科研人员,处理超大文档和进行长周期深度研究的场景;有私有化部署需求的企业客户,可以在权重开源后进行本地微调和部署。 不太适合立即使用的人群是:仅需要日常简单问答和文案写作的普通用户(很多平价模型足够);对响应速度要求极高的生产环境用户;没有足够预算或 GPU 资源的个人开发者,自部署门槛太高。 使用建议上,可以采取分层策略:将 K3 用于那 15%—20% 的复杂任务(长周期编程、多步骤 Agent、长文档深度分析),日常高频简单任务则搭配 K2.7 Code 或 DeepSeek V4 Pro 这类更轻量的模型。根据缓存策略优化 API 调用也能大幅降低成本。

  • Kimi K3 是一个里程碑式的产品,它让「开源模型」这个标签第一次真正站到了与顶尖闭源模型同台竞技的层面。它在编程和长程任务上的突破是真实的,也在行业和市场层面引发了巨大回响。但它整体上仍是一个「偏科型选手」——在特定场景下表现顶级,在通用场景中尚有差距。它的真正长期影响力或许不在今天的 API 调用量,而在于几天后权重正式开源后,它将作为基座模型赋能整个 AI 生态。

用户评论

  • 头像
    CarolynBakerJr
    K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。

  • 头像
    goldenlion904
    用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。

  • 头像
    Brjen
    API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。

  • 头像
    程彤云
    实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。

  • 头像
    KOgar
    得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。

  • 头像
    SandraHart168
    同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。

  • 头像
    游客_8
    办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。

  • 头像
    Madison_Hall_7
    精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。

  • 头像
    Karen836
    K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。

  • 头像
    月光_21
    最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。

  • 头像
    redzebra695
    前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。

  • 头像
    AbigailMitchell_2024
    把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。

  • 头像
    realSanjaSilić_dev
    用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。

  • 头像
    VEcoo
    这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。

  • 头像
    HashHunter114
    API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。

  • 头像
    Olivia.Brooks007
    刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。

  • 头像
    唐兰
    2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。

  • 头像
    Justin.Morales_99
    蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。

  • 头像
    DrErnestoMárquez_x
    编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。

  • 头像
    blPAR
    有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。

  • 头像
    Judy_Morales52014
    开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。

  • 头像
    Richard.RobertsX
    用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。

  • 头像
    胡勇丹
    做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。

  • 头像
    BCooper_2023
    普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。

  • 头像
    DanielleRamirez_668
    马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。

  • 头像
    VincentPerezZ
    刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。

  • 头像
    吴秀龙
    月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。

  • 头像
    MidhaelJensen
    第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。