Kimi K3 édition open source
Le plus grand modèle open source au monde, publié par Moonshot AI : 2 800 milliards de paramètres, multimodalité native et contexte d'un million de tokens, au sommet mondial en programmation
Rapport détaillé
-
Le 16 juillet 2026, Beijing Dark Side of the Moon Technology Co., Ltd. a publié Kimi K3, un grand modèle open source avec une échelle totale de paramètres de 2 800 milliards. Il s’agit actuellement du modèle open source avec les paramètres les plus grands au monde. Il est en tête de la liste de programmation frontale de Frontend Code Arena avec 1679 points, surpassant Claude Fable 5 et GPT-5.6 Sol. K3 est construit sur la base du mécanisme d'attention linéaire hybride KDA auto-développé et de la technologie de résidu d'attention. Il prend en charge nativement la compréhension visuelle et dispose d'une fenêtre contextuelle d'un million de jetons. Il est spécialement optimisé pour les scénarios de tâches complexes tels que la programmation à long terme, le travail de connaissances, la recherche approfondie et la compréhension multimodale. Il affiche des performances de pointe en matière de programmation d'endurance et de tâches d'agent, mais son intelligence globale globale est encore à la traîne par rapport aux modèles fermés les plus puissants.
-
Moonshot AI a été fondée en 2023 et a son siège à Pékin. Il s'agit d'une start-up d'IA investie par Alibaba et Hong Kong Investment Management Co., Ltd. (Hong Kong Investment). Le fondateur, Yang Zhilin, était auparavant professeur adjoint à l'Institut d'information croisée de l'Université Tsinghua. Les principaux membres de l'équipe proviennent d'universités de premier plan telles que l'université de Tsinghua et de Pékin et d'entreprises technologiques telles que Google et Meta. Kimi K3 est en développement depuis plus d'un an et est le successeur officiel de Kimi K2 (sorti en juillet 2025). Entre-temps, des versions itératives telles que K2.5, K2.6 et K2.7 Code ont également été publiées. La sortie de K3 réalise non seulement un saut qualitatif dans l'échelle des paramètres - passant du niveau de mille milliards de K2 à 2,8 mille milliards - mais apporte également trois innovations clés dans l'architecture sous-jacente : le mécanisme d'attention linéaire hybride KDA (Kimi Delta Attention), la technologie de résidu d'attention (Attention Residuals) et l'optimiseur de second ordre Moon Clip. Il convient de noter que la sortie de Kimi K3 a également provoqué une tempête dans l'industrie. Michael Kratzios, directeur du Bureau de la politique scientifique et technologique de la Maison Blanche, a accusé Dark Side of the Moon d'avoir développé K3 en distillant le modèle Fable d'Anthropic sur les réseaux sociaux, et a menacé de sanctions et de liste d'entités. Dean Ball, responsable du futur stratégique d'OpenAI, l'a également publiquement critiqué, le qualifiant de « force décélérationniste ». Huang Zhenxin, responsable de l'activité Dark Side of the Moon Enterprise, a répondu clairement que le cœur de l'augmentation des performances du K3 provenait de l'innovation architecturale originale sous-jacente et n'était pas une copie distillée du modèle existant. De nombreux médias faisant autorité et chercheurs en IA ont également déclaré publiquement que l’accusation manquait de fondement technique.
-
Les capacités principales de Kimi K3 se concentrent sur les directions suivantes. Le premier est la capacité de programmation, qui constitue le domaine le plus prometteur. Sur la liste des codes front-end de Frontend Code Arena, K3 se classe premier avec 1679 points, dépassant Claude Fable 5 (1631 points) et GPT-5.6 Sol (1618 points). L'expérience de programmation réelle est divisée en deux scénarios : l'un est utilisé via l'outil terminal Kimi Code, qui prend en charge la commutation de commande /model et convient aux tâches de programmation continue à long terme ; l'autre est appelé via l'API Kimi, qui est compatible avec le SDK OpenAI et coûte 0,3 $ par million de jetons pour les accès au cache, 3 $ pour les erreurs d'entrée et 15 $ pour la sortie. La seconde concerne les capacités de traitement des tâches longue distance. Les cas officiellement démontrés incluent la réalisation indépendante de la conception et de l'optimisation de la puce pendant 48 heures consécutives et la reproduction de la relation universelle I-Love-Q dans le domaine de l'astrophysique computationnelle en environ deux heures. K3 peut effectuer en continu des tâches d'ingénierie à long terme, comprendre et traiter de grandes bases de code et coordonner l'utilisation des outils de terminal avec une supervision humaine minimale. Le troisième concerne les capacités de compréhension multimodale. K3 prend nativement en charge la saisie multimodale d'images et de texte. Il ne s'agit pas d'un encodeur visuel plug-in, mais d'une véritable compréhension visuelle native. Cela signifie qu’il peut gérer simultanément les entrées de texte, d’image et de vidéo. Il existe quatre façons d'utiliser l'API. Discutez directement et gratuitement via l'application mobile Kimi (iOS/Android/HarmonyOS). La version de bureau de Kimi Work 3.1.0 et supérieure fournit une prise en charge des scènes de travail. L'outil terminal Kimi Code est destiné aux programmeurs. La plateforme API Kimi est destinée aux développeurs et aux utilisateurs d'entreprise. Le responsable fournit également la version entreprise de Kimi Enterprise, qui offre des fonctions de protection de la confidentialité des données et de gestion des membres. Du point de vue de l'expérience utilisateur réelle, les développeurs et programmeurs front-end donnent généralement des évaluations élevées et pensent que K3 « comprend avec précision l'intention de conception » lors de la génération de code front-end et de la restauration de l'interface utilisateur. Cependant, les retours des utilisateurs ordinaires sont polarisés : certaines personnes estiment qu'il est effectivement meilleur pour analyser de longs textes complexes, tandis que d'autres se plaignent qu'« il n'y a pas de grande différence dans les conversations quotidiennes ».
-
Le prix de l'API de Kimi K3 se situe dans le haut de gamme des modèles principaux chinois : la production est de 15 $ US par million de jetons, soit environ 100 RMB. La génération précédente K2.6 coûte 4 $, ce qui a été multiplié par près de 3. Le prix de production du modèle domestique similaire GLM-5.2 est de 4,4 dollars américains. Cependant, une donnée importante fournie par le responsable est la suivante : dans les scénarios de programmation, le taux de réussite du cache peut dépasser 90 %, de sorte que la dépense réelle est bien inférieure au prix indiqué. L’entrée dans le cache ne coûte que 0,3 $ par million de jetons. Selon les responsables, ce système qui s'appuie sur l'architecture de raisonnement séparée de Mooncake rend K3 très rentable dans les scénarios de programmation à haute fréquence. Huang Zhenxin, responsable de Dark Side of the Moon Enterprise Business, a clairement indiqué que les modèles open source et les grands modèles chinois ne devraient pas être qualifiés de bas prix. "Nous avons construit un modèle de niveau SOTA qui peut également correspondre à des prix commerciaux raisonnables." Les calculs d'Artificial Analysis montrent que le coût d'une seule tâche de Kimi K3 est d'environ 0,94 $ US, ce qui est proche des 1,04 $ US de GPT-5.6 Sol. Ce n’est pas beaucoup moins cher qu’il n’y paraît à première vue. Du côté des consommateurs, la version gratuite de Kimi comprend un certain quota K3, et l'abonnement payant est divisé en plusieurs niveaux, jusqu'à 699 yuans/mois. Certains utilisateurs ont signalé que 20 % de leur quota avait été utilisé en une journée, ce qui signifie que le coût pour les gros utilisateurs ne peut être ignoré. Dark Side of the Moon dit qu'il s'en tiendra à la voie de l'open source. Poids du modèle complet publiés avant le 27 juillet 2026, sous une licence MIT modifiée. Pour les entreprises clientes ayant des besoins de déploiement et de réglage privés, l’open source est une option de grande valeur.
-
Les commentaires positifs portent principalement sur trois aspects. Premièrement, l'expérience dans les scénarios de programmation est excellente, la génération de code frontal est de haute qualité et l'intention de conception est comprise avec précision. Le fondateur de Vercel, Guillermo Rauch, a également effectué des tests et des vérifications réels. Deuxièmement, sa capacité à traiter de longs textes et de longues tâches est exceptionnelle. Les utilisateurs ont signalé qu'en insérant des dizaines de pages de documents dans un résumé, K3 peut extraire avec précision les informations clés, les soustraire de manière proactive et « commencer à avoir un meilleur jugement ». Troisièmement, les capacités d'automatisation dans les scénarios professionnels (analyse financière, revue de contrat, recherche industrielle) sont satisfaisantes. Certains utilisateurs l'ont utilisé pour trouver des clauses cachées de renouvellement automatique dans les contrats. Les critiques négatives sont également évidentes. La plainte la plus courante est la lenteur de la réponse : une tâche similaire, Claude Fable 5, a pris 3,5 minutes, tandis que K3 a pris 12 minutes. La réactivité de l'API est inférieure à la moyenne de la catégorie. Deuxièmement, les prix sont élevés. De K2,6 à K3, le prix à la production a presque triplé. Là encore, il y a le problème du « raisonnement excessif ». Certains utilisateurs signalent que K3 élargira la portée des tâches de sa propre initiative avec des intentions vagues, augmentant ainsi les coûts de refonte. Il existe également des retours d'utilisateurs selon lesquels aucune amélioration significative ne peut être ressentie dans les scénarios d'éclairage quotidiens.
-
Les médias du secteur en ont généralement fait l’éloge. L'Economic Daily a interprété cela comme un nouveau nœud permettant aux grands modèles chinois d'évoluer vers un pouvoir de fixation des prix. Un rapport de recherche de Goldman Sachs estime que les grands modèles chinois sont auparavant entrés sur le marché mondial principalement sur la base de la performance des coûts et qu'à l'avenir, ils pourraient s'appuyer sur des capacités de pointe pour entrer dans le flux de travail principal des développeurs mondiaux. Morgan Stanley s'inquiète du fait que le prix API du Kimi K3 se situe à un niveau élevé parmi les meilleurs modèles chinois et estime qu'un prix plus élevé a une signification positive pour la structure du marché des grands modèles. La communauté technologique est divisée. Certains développeurs estiment qu'il s'agit « d'un tournant pour le modèle open source dans le domaine de la programmation », car c'est la première fois qu'un modèle open source surpasse complètement tous les modèles fermés dans la compétition de code front-end. D'autres pensent que Benchmark appartient à Benchmark et que la « lenteur et le coût » de l'utilisation réelle sont des coûts objectifs inévitables. Certains experts du secteur ont également souligné que la valeur réelle du K3 n'est pas seulement ressentie par le côté C, mais qu'il servira de modèle de base pour responsabiliser un grand nombre de petites et moyennes entreprises. Une fois que les pondérations des modèles sont open source, un grand nombre d'entreprises nationales n'ont pas besoin de former de grands modèles à partir de zéro. En termes de marchés de capitaux, les actions américaines d’IA ont connu une vague de baisse après la sortie de K3, reflétant les inquiétudes des investisseurs selon lesquelles les modèles de pointe open source pourraient avoir un impact sur les capacités de tarification des sources fermées. Elon Musk a laissé deux commentaires « impressionnants » dans des commentaires connexes et a répertorié K3 comme cible clé pour Grok 4.6.
-
La taxe de distillation était la principale controverse. La Maison Blanche a directement porté cette accusation, mais les experts techniques estiment généralement que cette accusation est intenable. L'expert américain en technologie de l'IA Nathan Lambert a écrit publiquement que ceux qui croient que les laboratoires chinois d'IA peuvent produire d'excellents modèles simplement en volant la propriété intellectuelle "il est temps de se réveiller". Dean Ball, responsable de l'avenir stratégique d'OpenAI, a également admis dans un article controversé que les performances du K3 ne peuvent pas être obtenues par distillation. En termes de risques techniques, la lenteur de l’inférence du modèle constitue actuellement la lacune la plus importante. Pour les environnements de production nécessitant des temps de réponse rapides, K3 n’est peut-être pas le meilleur choix. De plus, le modèle a tendance à « trop raisonner » et est enclin à élargir de manière proactive la portée des tâches sans instructions explicites, ce qui présente des risques dans les scénarios nécessitant un contrôle strict des limites. Il existe de réels problèmes de conformité et de sécurité des données. Les données du service d'hébergement de Kimi sont traitées en Chine, ce qui constitue un facteur important pour les utilisateurs étrangers soumis à des restrictions sur l'exportation de données. Bien que les poids open source puissent être déployés localement après leur publication, le seuil de déploiement du modèle de 2,8 billions de paramètres est extrêmement élevé - la recommandation officielle est une configuration de super-nœuds de plus de 64 accélérateurs, ce qui est fondamentalement inabordable pour les entreprises et les particuliers ordinaires. Le problème de l’illusion du modèle n’est pas non plus complètement résolu. Huang Zhenxin lui-même a admis que « les hallucinations ne peuvent pas être complètement éradiquées ». Cependant, K3 a considérablement réduit son incidence et nécessite le sous-agent de vérification des faits dans l'architecture Agent Swarm pour une vérification secondaire.
-
Les personnes aptes à utiliser Kimi K3 sont : les développeurs front-end et les ingénieurs full-stack, en particulier les équipes engagées dans le développement d'interfaces utilisateur complexes et l'ingénierie front-end ; Ingénieurs et chercheurs AI Agent qui ont besoin d’une programmation automatisée à long terme ; les analystes financiers, les chercheurs industriels et les chercheurs scientifiques, qui traitent des documents très volumineux et mènent des scénarios de recherche approfondie à long terme ; Les entreprises clientes ayant des besoins de déploiement privatisés peuvent effectuer un réglage et un déploiement locaux une fois que les pondérations sont open source. Les personnes qui ne sont pas adaptées à une utilisation immédiate sont : les utilisateurs ordinaires qui n'ont besoin que de simples questions-réponses et de rédaction quotidiennes (de nombreux modèles abordables suffisent) ; les utilisateurs d'un environnement de production qui ont besoin d'une vitesse de réponse extrêmement élevée ; des développeurs individuels qui ne disposent pas de suffisamment de budget ou de ressources GPU et dont le seuil d'auto-déploiement est trop élevé. En termes de recommandations d'utilisation, vous pouvez adopter une stratégie à plusieurs niveaux : utiliser K3 pour 15 à 20 % des tâches complexes (programmation à cycle long, agents multi-étapes, analyse approfondie de documents longs) et utiliser des modèles plus légers tels que K2.7 Code ou DeepSeek V4 Pro pour les tâches simples quotidiennes à haute fréquence. L'optimisation des appels d'API basée sur des stratégies de mise en cache peut également réduire considérablement les coûts.
-
Kimi K3 est un produit phare. Cela permet au label « modèle open source » de véritablement rivaliser avec les meilleurs modèles fermés pour la première fois. Ses avancées en matière de programmation et de tâches à long terme sont réelles et ont également eu d'énormes répercussions au niveau de l'industrie et du marché. Mais dans l’ensemble, il s’agit toujours d’un « acteur scientifique » : il est excellent dans des scénarios spécifiques, mais il existe encore des lacunes dans les scénarios généraux. Sa véritable influence à long terme ne réside peut-être pas dans le nombre d'appels d'API aujourd'hui, mais dans le fait qu'une fois que le poids sera officiellement open source dans quelques jours, il servira de modèle de base pour responsabiliser l'ensemble de l'écosystème de l'IA.
Avis des utilisateurs
-
CarolynBakerJr—K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。 -
goldenlion904—用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。 -
Brjen—API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。 -
程彤云—实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。 -
KOgar—得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。 -
SandraHart168—同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。 -
游客_8—办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。 -
Madison_Hall_7—精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。 -
Karen836—K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。 -
月光_21—最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。 -
redzebra695—前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。 -
AbigailMitchell_2024—把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。 -
realSanjaSilić_dev—用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。 -
VEcoo—这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。 -
HashHunter114—API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。 -
Olivia.Brooks007—刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。 -
唐兰—2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。 -
Justin.Morales_99—蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。 -
DrErnestoMárquez_x—编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。 -
blPAR—有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。 -
Judy_Morales52014—开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。 -
Richard.RobertsX—用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。 -
胡勇丹—做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。 -
BCooper_2023—普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。 -
DanielleRamirez_668—马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。 -
VincentPerezZ—刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。 -
吴秀龙—月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。 -
MidhaelJensen—第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。