Kimi K3 edição open source
O maior modelo de linguagem open source do mundo, da Moonshot AI: 2,8 trilhões de parâmetros, multimodalidade nativa e contexto de 1 milhão de tokens, líder global em programação
Relatório detalhado
-
Em 16 de julho de 2026, a Beijing Dark Side of the Moon Technology Co., Ltd. lançou o Kimi K3, um grande modelo de código aberto com uma escala total de parâmetros de 2,8 trilhões. Este é atualmente o modelo de código aberto com os maiores parâmetros do mundo. Ele liderou a lista de programação front-end do Frontend Code Arena com 1.679 pontos, superando Claude Fable 5 e GPT-5.6 Sol. O K3 é construído com base no mecanismo de atenção linear híbrido KDA desenvolvido pela própria KDA e na tecnologia de atenção residual. Ele oferece suporte nativo à compreensão visual e possui uma janela de contexto de 1 milhão de tokens. É especialmente otimizado para cenários de tarefas complexas, como programação de longo alcance, trabalho de conhecimento, pesquisa aprofundada e compreensão multimodal. Ele mostra desempenho de ponta em programação de resistência e tarefas de agente, mas sua inteligência geral abrangente ainda fica atrás dos modelos de código fechado mais fortes.
-
Moonshot AI foi fundada em 2023 e está sediada em Pequim. É uma empresa iniciante de IA investida pela Alibaba e Hong Kong Investment Management Co., Ltd. O fundador, Yang Zhilin, foi anteriormente professor assistente no Instituto de Informação Cruzada da Universidade Tsinghua. Os membros principais da equipe vêm de universidades importantes, como Tsinghua e Universidade de Pequim, e de empresas de tecnologia como Google e Meta. Kimi K3 está em desenvolvimento há mais de um ano e é o sucessor oficial do Kimi K2 (lançado em julho de 2025). Enquanto isso, versões iterativas como K2.5, K2.6 e K2.7 Code também foram lançadas. O lançamento do K3 não apenas alcança um salto qualitativo na escala de parâmetros - saltando do nível de trilhões de K2 para 2,8 trilhões - mas também traz três inovações importantes na arquitetura subjacente: mecanismo de atenção linear híbrido KDA (Kimi Delta Attention), tecnologia de atenção residual (Attention Residuals) e otimizador de segunda ordem Moon Clip. É importante notar que o lançamento do Kimi K3 também causou uma tempestade na indústria. Michael Kratzios, diretor do Escritório de Política Científica e Tecnológica da Casa Branca, acusou Dark Side of the Moon de desenvolver K3 destilando o modelo Anthropic's Fable nas redes sociais e ameaçou com sanções e uma lista de entidades. Dean Ball, chefe de futuro estratégico da OpenAI, também a criticou publicamente, chamando-a de “força desaceleracionista”. Huang Zhenxin, chefe do negócio Dark Side of the Moon Enterprise, respondeu claramente que o núcleo do salto de desempenho do K3 vem da inovação arquitetônica original subjacente e não é uma cópia destilada do modelo existente. Muitos meios de comunicação autorizados e estudiosos de pesquisa em IA também declararam publicamente que a acusação carecia de base técnica.
-
As principais capacidades do Kimi K3 concentram-se nas seguintes direções. A primeira é a capacidade de programação, que é a sua área mais promissora. Na lista de códigos frontend do Frontend Code Arena, o K3 ocupa o primeiro lugar com 1.679 pontos, superando Claude Fable 5 (1.631 pontos) e GPT-5.6 Sol (1.618 pontos). A experiência de programação real é dividida em dois cenários: um é usado por meio da ferramenta de terminal Kimi Code, que suporta comutação de comando /model e é adequado para tarefas de programação contínua de longo prazo; o outro é chamado por meio da API Kimi, que é compatível com o OpenAI SDK e custa US$ 0,3 por milhão de tokens para acertos de cache, US$ 3 para falhas de entrada e US$ 15 para saída. A segunda são as capacidades de processamento de tarefas de longa distância. Os casos oficialmente demonstrados incluem a conclusão independente do projeto e otimização do chip por 48 horas consecutivas e a reprodução da relação universal I-Love-Q no campo da astrofísica computacional em cerca de duas horas. O K3 pode concluir continuamente tarefas de engenharia de longo prazo, compreender e processar grandes bases de código e coordenar o uso de ferramentas de terminal com supervisão humana mínima. O terceiro são as capacidades de compreensão multimodal. K3 suporta nativamente entrada multimodal de imagens e texto. Não é um codificador visual plug-in, mas um verdadeiro entendimento visual nativo. Isso significa que ele pode lidar com entrada de texto, imagem e vídeo simultaneamente. Existem quatro maneiras de usar a API. Converse diretamente e gratuitamente através do aplicativo móvel Kimi (iOS/Android/HarmonyOS). A versão desktop do Kimi Work 3.1.0 e superior fornece suporte para cenas de trabalho. A ferramenta de terminal Kimi Code é voltada para programadores. A plataforma Kimi API é voltada para desenvolvedores e usuários corporativos. O funcionário também fornece a versão empresarial Kimi Enterprise, que fornece proteção de privacidade de dados e funções de gerenciamento de membros. Do ponto de vista da experiência real do usuário, os desenvolvedores e programadores front-end geralmente dão avaliações altas e acreditam que K3 "entende a intenção do design com precisão" na geração de código front-end e na restauração da interface do usuário. No entanto, o feedback dos usuários comuns é polarizado - algumas pessoas acham que é realmente melhor analisar textos longos e complexos, enquanto outras reclamam que “não há grande diferença nas conversas diárias”.
-
O preço da API do Kimi K3 está no topo dos modelos principais da China – a produção é de US$ 15 por milhão de tokens, o que é aproximadamente 100 RMB. A geração anterior K2.6 custa US$ 4, o que aumentou quase 3 vezes. O preço de produção do modelo doméstico similar GLM-5.2 é de US$ 4,4. No entanto, um dado importante fornecido pelo responsável é: em cenários de programação, a taxa de acerto do cache pode ultrapassar os 90%, pelo que a despesa real é muito inferior ao preço listado. A entrada de acesso ao cache custa apenas US$ 0,3 por milhão de tokens. De acordo com as autoridades, este sistema que depende da arquitetura de raciocínio separada do Mooncake torna o K3 altamente econômico em cenários de programação de alta frequência. Huang Zhenxin, chefe do Dark Side of the Moon Enterprise Business, deixou claro que os modelos de código aberto e os grandes modelos chineses não devem ser rotulados como de baixo preço. “Construímos um modelo de nível SOTA que também pode corresponder a preços comerciais razoáveis”. Os cálculos da Análise Artificial mostram que o custo de tarefa única do Kimi K3 é de cerca de US$ 0,94, o que está próximo dos US$ 1,04 do GPT-5.6 Sol. Não é muito mais barato do que parece superficialmente. Do lado do consumidor, a versão gratuita do Kimi inclui uma certa cota K3, e a assinatura paga é dividida em vários níveis, até 699 yuans/mês. Alguns utilizadores relataram que 20% da sua quota foi utilizada num dia, o que significa que o custo para os utilizadores frequentes não pode ser ignorado. Dark Side of the Moon diz que seguirá a rota do código aberto. Pesos completos do modelo lançados antes de 27 de julho de 2026, sob uma licença modificada do MIT. Para clientes corporativos com implantação privada e necessidades de ajuste fino, o código aberto é uma opção de alto valor.
-
Os comentários positivos concentram-se principalmente em três aspectos. Primeiro, a experiência em cenários de programação é excelente, a geração de código front-end é de alta qualidade e a intenção do design é compreendida com precisão. O fundador da Vercel, Guillermo Rauch, também conduziu testes e verificações reais. Em segundo lugar, a sua capacidade de processar textos longos e tarefas longas é excelente. Os usuários relataram que, ao colocar dezenas de páginas de documentos em um resumo, o K3 pode extrair informações importantes com precisão, subtrair proativamente e “começar a ter um melhor julgamento”. Terceiro, as capacidades de automação em cenários profissionais (análise financeira, revisão de contratos, pesquisa industrial) são satisfatórias. Alguns usuários o utilizaram para encontrar cláusulas ocultas de renovação automática em contratos. Avaliações negativas também são evidentes. A reclamação mais comum é a lentidão na velocidade de resposta - uma tarefa semelhante, Claude Fable 5, demorou 3,5 minutos, enquanto K3 demorou 12 minutos. A capacidade de resposta da API está abaixo da média da categoria. Em segundo lugar, o preço é alto. De K2.6 a K3, o preço de produção aumentou quase três vezes. Novamente, existe o problema do “raciocínio excessivo”. Alguns usuários relatam que o K3 expandirá o escopo das tarefas por iniciativa própria com intenções vagas, aumentando os custos de retrabalho. Há também feedback dos usuários de que nenhuma melhoria significativa pode ser sentida em cenários de luz diária.
-
A mídia da indústria geralmente elogiou isso. O Economic Daily interpretou isto como um novo nó para os grandes modelos da China avançarem em direcção ao poder de fixação de preços. Um relatório de pesquisa da Goldman Sachs acredita que os grandes modelos da China já entraram no mercado global principalmente com base no desempenho de custos e, no futuro, poderão contar com capacidades de ponta para entrar no fluxo de trabalho central dos desenvolvedores globais. O Morgan Stanley está preocupado com o facto de o preço API do Kimi K3 estar num nível elevado entre os principais modelos da China e acredita que preços mais elevados têm um significado positivo para a estrutura de mercado dos grandes modelos. A comunidade tecnológica está dividida. Alguns desenvolvedores acreditam que é "um ponto de viragem para o modelo de código aberto no campo da programação" porque é a primeira vez que um modelo de código aberto supera completamente todos os modelos de código fechado na competição de código front-end. Outros acreditam que o Benchmark pertence ao Benchmark e que a "lentidão e o custo" do uso real são custos objetivos inevitáveis. Alguns especialistas da indústria também salientaram que o valor real do K3 não é apenas sentido no lado C, mas que servirá como modelo base para capacitar um grande número de pequenas e médias empresas. Depois que os pesos dos modelos são de código aberto, um grande número de empresas nacionais não precisa treinar grandes modelos do zero. Em termos de mercados de capitais, as ações de IA dos EUA registaram uma onda de quedas após o lançamento do K3, refletindo as preocupações dos investidores de que os modelos de ponta de código aberto possam afetar as capacidades de preços de código fechado. Elon Musk deixou dois comentários sobre “impressionante” em comentários relacionados e listou o K3 como um alvo principal para o Grok 4.6.
-
A taxa de destilação foi a principal polêmica. A Casa Branca fez a acusação diretamente, mas os especialistas técnicos geralmente acreditam que esta acusação é insustentável. O especialista americano em tecnologia de IA Nathan Lambert escreveu publicamente que as pessoas que acreditam que os laboratórios chineses de IA podem produzir modelos excelentes simplesmente roubando propriedade intelectual "é hora de acordar". O chefe de futuro estratégico da OpenAI, Dean Ball, também admitiu no polêmico post que o desempenho do K3 não pode ser alcançado por destilação. Em termos de riscos técnicos, a lenta velocidade de inferência do modelo é atualmente a deficiência mais proeminente. Para ambientes de produção que exigem tempos de resposta rápidos, o K3 pode não ser a melhor escolha. Além disso, o modelo tem tendência a "raciocinar excessivamente" e é propenso a expandir proativamente o escopo das tarefas sem instruções explícitas, o que representa riscos em cenários que exigem controle rigoroso dos limites. Existem problemas reais em torno da conformidade e da segurança dos dados. Os dados no serviço de hospedagem de Kimi são processados na China, o que é uma consideração importante para usuários estrangeiros com restrições à exportação de dados. Embora os pesos de código aberto possam ser implantados localmente após o lançamento, o limite de implantação do modelo de parâmetros de 2,8 trilhões é extremamente alto - a recomendação oficial é uma configuração de supernó com mais de 64 aceleradores, o que é basicamente inacessível para empresas e indivíduos comuns. O problema da ilusão do modelo também não foi completamente resolvido. O próprio Huang Zhenxin admitiu que “as alucinações não podem ser completamente erradicadas”. No entanto, o K3 reduziu significativamente sua incidência e requer o subagente verificador de fatos na arquitetura Agent Swarm para verificação secundária.
-
As pessoas adequadas para usar o Kimi K3 são: desenvolvedores front-end e engenheiros full-stack, especialmente equipes envolvidas no desenvolvimento de UI complexo e engenharia front-end; Engenheiros e pesquisadores de agentes de IA que precisam de programação automatizada de longo prazo; analistas financeiros, investigadores da indústria e investigadores científicos, que lidam com documentos muito grandes e conduzem cenários de investigação aprofundados a longo prazo; clientes corporativos com requisitos de implantação privatizados podem realizar ajustes e implantação locais depois que os pesos forem de código aberto. As pessoas que não são adequadas para uso imediato são: usuários comuns que precisam apenas de perguntas e respostas simples e redação diária (muitos modelos acessíveis são suficientes); usuários de ambiente de produção que exigem velocidade de resposta extremamente alta; desenvolvedores individuais que não têm orçamento ou recursos de GPU suficientes e o limite para autoimplantação é muito alto. Em termos de recomendações de uso, você pode adotar uma estratégia em camadas: usar K3 para 15%-20% de tarefas complexas (programação de ciclo longo, agentes de várias etapas, análise aprofundada de documentos longos) e usar modelos mais leves, como K2.7 Code ou DeepSeek V4 Pro para tarefas simples diárias de alta frequência. A otimização das chamadas de API com base em estratégias de cache também pode reduzir significativamente os custos.
-
Kimi K3 é um produto marcante. Ele permite que o rótulo “modelo de código aberto” concorra verdadeiramente com os principais modelos de código fechado pela primeira vez. Os seus avanços na programação e nas tarefas de longo alcance são reais e também causaram enormes repercussões a nível da indústria e do mercado. Mas no geral ainda é um “jogador científico” – tem um desempenho excelente em cenários específicos, mas ainda há uma lacuna nos cenários gerais. Sua influência real a longo prazo pode não estar no número de chamadas de API hoje, mas no fato de que depois que o peso for oficialmente aberto em alguns dias, ele servirá como um modelo básico para capacitar todo o ecossistema de IA.
Avaliações de usuários
-
CarolynBakerJr—K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。 -
goldenlion904—用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。 -
Brjen—API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。 -
程彤云—实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。 -
KOgar—得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。 -
SandraHart168—同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。 -
游客_8—办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。 -
Madison_Hall_7—精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。 -
Karen836—K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。 -
月光_21—最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。 -
redzebra695—前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。 -
AbigailMitchell_2024—把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。 -
realSanjaSilić_dev—用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。 -
VEcoo—这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。 -
HashHunter114—API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。 -
Olivia.Brooks007—刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。 -
唐兰—2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。 -
Justin.Morales_99—蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。 -
DrErnestoMárquez_x—编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。 -
blPAR—有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。 -
Judy_Morales52014—开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。 -
Richard.RobertsX—用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。 -
胡勇丹—做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。 -
BCooper_2023—普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。 -
DanielleRamirez_668—马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。 -
VincentPerezZ—刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。 -
吴秀龙—月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。 -
MidhaelJensen—第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。