Kimi K3 edición open source
El mayor modelo de lenguaje open source del mundo, de Moonshot AI: 2,8 billones de parámetros, multimodalidad nativa y contexto de 1 millón de tokens, líder mundial en programación
Informe detallado
-
El 16 de julio de 2026, Beijing Dark Side of the Moon Technology Co., Ltd. lanzó Kimi K3, un gran modelo de código abierto con una escala de parámetros total de 2,8 billones. Este es actualmente el modelo de código abierto con mayores parámetros del mundo. Encabezó la lista de programación front-end de Frontend Code Arena con 1679 puntos, superando a Claude Fable 5 y GPT-5.6 Sol. K3 está construido sobre la base del mecanismo de atención lineal híbrido KDA de desarrollo propio y la tecnología de atención residual. Admite de forma nativa la comprensión visual y tiene una ventana de contexto de 1 millón de tokens. Está especialmente optimizado para escenarios de tareas complejas, como programación de largo alcance, trabajo de conocimiento, investigación en profundidad y comprensión multimodal. Muestra un rendimiento de vanguardia en programación de resistencia y tareas de agentes, pero su inteligencia integral general aún está por detrás de los modelos de código cerrado más potentes.
-
Moonshot AI se fundó en 2023 y tiene su sede en Beijing. Es una nueva empresa de IA con inversión de Alibaba y Hong Kong Investment Management Co., Ltd. (Hong Kong Investment). El fundador, Yang Zhilin, fue anteriormente profesor asistente en el Instituto de Información Cruzada de la Universidad de Tsinghua. Los miembros principales del equipo provienen de las mejores universidades, como Tsinghua y la Universidad de Pekín, y de empresas de tecnología como Google y Meta. Kimi K3 ha estado en desarrollo durante más de un año y es el sucesor oficial de Kimi K2 (lanzado en julio de 2025). Mientras tanto, también se lanzaron versiones iterativas como K2.5, K2.6 y K2.7 Code. El lanzamiento de K3 no solo logra un salto cualitativo en la escala de parámetros (saltando del nivel de billones de K2 a 2,8 billones), sino que también realiza tres innovaciones clave en la arquitectura subyacente: el mecanismo de atención lineal híbrido KDA (Kimi Delta Attention), la tecnología de atención residual (Attention Residuals) y el optimizador de segundo orden Moon Clip. Vale la pena señalar que el lanzamiento de Kimi K3 también provocó una tormenta en la industria. Michael Kratzios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca, acusó a Dark Side of the Moon de desarrollar K3 destilando el modelo Fable de Anthropic en las redes sociales y amenazó con sanciones y una lista de entidades. Dean Ball, jefe de futuro estratégico de OpenAI, también lo criticó públicamente, calificándolo de "fuerza desaceleracionista". Huang Zhenxin, director del negocio Dark Side of the Moon Enterprise, respondió claramente que el núcleo del salto de rendimiento del K3 proviene de la innovación arquitectónica original subyacente y no es una copia destilada del modelo existente. Muchos medios de comunicación autorizados y académicos de investigación en IA también declararon públicamente que la acusación carecía de base técnica.
-
Las capacidades principales de Kimi K3 se centran en las siguientes direcciones. La primera es la capacidad de programación, que es su área más prometedora. En la lista de códigos front-end de Frontend Code Arena, K3 ocupa el primer lugar con 1679 puntos, superando a Claude Fable 5 (1631 puntos) y GPT-5.6 Sol (1618 puntos). La experiencia de programación real se divide en dos escenarios: uno se utiliza a través de la herramienta de terminal Kimi Code, que admite el cambio de comando / modelo y es adecuado para tareas de programación continua a largo plazo; el otro se llama a través de la API Kimi, que es compatible con el SDK de OpenAI y tiene un precio de 0,3 dólares por millón de tokens para aciertos de caché, 3 dólares por errores de entrada y 15 dólares por salida. El segundo son las capacidades de procesamiento de tareas a larga distancia. Los casos oficialmente demostrados incluyen completar de forma independiente el diseño y optimización del chip durante 48 horas consecutivas y reproducir la relación universal I-Love-Q en el campo de la astrofísica computacional en aproximadamente dos horas. K3 puede completar continuamente tareas de ingeniería a largo plazo, comprender y procesar grandes bases de código y coordinar el uso de herramientas terminales con una mínima supervisión humana. El tercero son las capacidades de comprensión multimodal. K3 admite de forma nativa la entrada multimodal de imágenes y texto. No es un codificador visual enchufable, sino una verdadera comprensión visual nativa. Esto significa que puede manejar entrada de texto, imágenes y vídeo simultáneamente. Hay cuatro formas de utilizar la API. Chatea directamente y gratis a través de la aplicación móvil Kimi (iOS/Android/HarmonyOS). La versión de escritorio de Kimi Work 3.1.0 y superior brinda soporte para escenas de trabajo. La herramienta terminal Kimi Code está dirigida a programadores. La plataforma Kimi API está dirigida a desarrolladores y usuarios empresariales. El funcionario también proporciona la versión empresarial Kimi Enterprise, que brinda protección de la privacidad de datos y funciones de administración de miembros. Desde la perspectiva de la experiencia real del usuario, los desarrolladores y programadores de front-end generalmente otorgan altas evaluaciones y creen que K3 "comprende con precisión la intención del diseño" en la generación de código de front-end y la restauración de la interfaz de usuario. Sin embargo, las opiniones de los usuarios comunes están polarizadas: algunas personas consideran que analiza mejor textos largos y complejos, mientras que otros se quejan de que "no hay una gran diferencia en las conversaciones diarias".
-
El precio API de Kimi K3 se encuentra en el extremo superior de los principales modelos de China: la producción es de 15 dólares por millón de tokens, lo que equivale aproximadamente a 100 RMB. La generación anterior del K2.6 cuesta 4 dólares, lo que ha aumentado casi 3 veces. El precio de producción del modelo nacional similar GLM-5.2 es de 4,4 dólares estadounidenses. Sin embargo, un dato importante proporcionado por el funcionario es: en escenarios de programación, la tasa de aciertos de caché puede exceder el 90%, por lo que el gasto real es mucho menor que el precio indicado. La entrada de caché cuesta sólo 0,3 dólares por millón de tokens. Según los funcionarios, este sistema que se basa en la arquitectura de razonamiento separado de Mooncake hace que K3 sea altamente rentable en escenarios de programación de alta frecuencia. Huang Zhenxin, director de Dark Side of the Moon Enterprise Business, dejó claro que los modelos de código abierto y los grandes modelos chinos no deben etiquetarse como de bajo precio. "Hemos creado un modelo de nivel SOTA que también puede igualar precios comerciales razonables". Los cálculos de Artificial Analysis muestran que el costo de una sola tarea de Kimi K3 es de aproximadamente 0,94 dólares estadounidenses, cerca de 1,04 dólares estadounidenses del GPT-5.6 Sol. No es mucho más barato de lo que parece en la superficie. Del lado del consumidor, la versión gratuita de Kimi incluye una determinada cuota K3 y la membresía paga se divide en varios niveles, hasta 699 yuanes al mes. Algunos usuarios informaron que utilizaron el 20% de su cuota en un día, lo que significa que no se puede ignorar el costo para los usuarios habituales. Dark Side of the Moon dice que se apegará a la ruta del código abierto. Pesos completos del modelo publicados antes del 27 de julio de 2026, bajo una licencia MIT modificada. Para los clientes empresariales con necesidades de implementación y ajuste privado, el código abierto es una opción de alto valor.
-
Los comentarios positivos se centran principalmente en tres aspectos. Primero, la experiencia en escenarios de programación es excelente, la generación de código front-end es de alta calidad y la intención del diseño se comprende con precisión. El fundador de Vercel, Guillermo Rauch, también realizó pruebas y verificaciones reales. En segundo lugar, su capacidad para procesar textos largos y tareas extensas es sobresaliente. Los usuarios informaron que al incluir docenas de páginas de documentos en un resumen, K3 puede extraer con precisión información clave, restar proactivamente y "comenzar a tener un mejor juicio". En tercer lugar, las capacidades de automatización en escenarios profesionales (análisis financiero, revisión de contratos, investigación industrial) son satisfactorias. Algunos usuarios lo han utilizado para encontrar cláusulas ocultas de renovación automática en los contratos. Las críticas negativas también son evidentes. La queja más común es la lentitud de respuesta: una tarea similar, Claude Fable 5, tardó 3,5 minutos, mientras que K3 tardó 12 minutos. La capacidad de respuesta de la API está por debajo del promedio de la categoría. En segundo lugar, el precio es elevado. De K2,6 a K3, el precio de producción ha aumentado casi tres veces. De nuevo surge el problema del "razonamiento excesivo". Algunos usuarios informan que K3 ampliará el alcance de las tareas por iniciativa propia con intenciones vagas, aumentando los costos de retrabajo. También hay comentarios de los usuarios que no notan ninguna mejora significativa en los escenarios de iluminación diarios.
-
The industry media generally spoke highly of it. El Economic Daily interpretó esto como un nuevo nodo para que los grandes modelos de China avancen hacia el poder de fijación de precios. Un informe de investigación de Goldman Sachs cree que los modelos grandes de China han ingresado anteriormente al mercado global basándose principalmente en el desempeño de costos, y en el futuro pueden depender de capacidades de vanguardia para ingresar al flujo de trabajo central de los desarrolladores globales. A Morgan Stanley le preocupa que el precio API del Kimi K3 esté en un nivel alto entre los mejores modelos de China y cree que un precio más alto tiene un significado positivo para la estructura del mercado de los modelos grandes. The tech community is divided. Algunos desarrolladores creen que es "un punto de inflexión para el modelo de código abierto en el campo de la programación", porque es la primera vez que un modelo de código abierto supera por completo a todos los modelos de código cerrado en la competencia de código front-end. Otros creen que Benchmark pertenece a Benchmark y que la "lentitud y el costo" en el uso real son costos objetivos inevitables. Algunos expertos de la industria también señalaron que el valor real de K3 no sólo se experimenta en el lado C, sino que servirá como modelo base para empoderar a un gran número de pequeñas y medianas empresas. Una vez que los pesos del modelo son de código abierto, una gran cantidad de empresas nacionales no necesitan entrenar modelos grandes desde cero. En términos de mercados de capital, las acciones de IA de EE. UU. experimentaron una ola de caídas después del lanzamiento de K3, lo que refleja las preocupaciones de los inversores de que los modelos de vanguardia de código abierto puedan afectar las capacidades de fijación de precios de código cerrado. Elon Musk dejó dos comentarios sobre "impresionante" en comentarios relacionados y mencionó a K3 como un objetivo clave para Grok 4.6.
-
La carga de destilación fue la principal controversia. La Casa Blanca hizo directamente la acusación, pero los expertos técnicos en general creen que esta acusación es insostenible. El experto estadounidense en tecnología de IA, Nathan Lambert, escribió públicamente que las personas que creen que los laboratorios chinos de IA pueden producir modelos excelentes simplemente robando propiedad intelectual "es hora de despertar". El jefe de futuro estratégico de OpenAI, Dean Ball, también admitió en la controvertida publicación que el rendimiento de K3 no se puede lograr mediante destilación. En términos de riesgos técnicos, la lenta velocidad de inferencia del modelo es actualmente la deficiencia más destacada. Para entornos de producción que requieren tiempos de respuesta rápidos, es posible que K3 no sea la mejor opción. Además, el modelo tiende a "razonar demasiado" y es propenso a ampliar proactivamente el alcance de las tareas sin instrucciones explícitas, lo que plantea riesgos en escenarios que requieren un control estricto de los límites. Existen problemas reales en torno al cumplimiento y la seguridad de los datos. Los datos del servicio de hosting de Kimi se procesan dentro de China, lo cual es una consideración importante para los usuarios extranjeros con restricciones de exportación de datos. Aunque los pesos de código abierto se pueden implementar localmente después del lanzamiento, el umbral de implementación del modelo de parámetros de 2,8 billones es extremadamente alto: la recomendación oficial es una configuración de supernodo de más de 64 aceleradores, que es básicamente inasequible para empresas e individuos comunes. El problema de la ilusión modelo tampoco se ha resuelto por completo. El propio Huang Zhenxin admitió que "las alucinaciones no se pueden erradicar por completo". Sin embargo, K3 ha reducido significativamente su incidencia y requiere el subagente de verificación de datos en la arquitectura Agent Swarm para la verificación secundaria.
-
Las personas adecuadas para usar Kimi K3 son: desarrolladores front-end e ingenieros full-stack, especialmente equipos involucrados en desarrollo de UI complejo e ingeniería front-end; Ingenieros e investigadores de agentes de IA que necesitan programación automatizada a largo plazo; analistas financieros, investigadores de la industria e investigadores científicos, que se ocupan de documentos muy extensos y realizan escenarios de investigación en profundidad a largo plazo; Los clientes empresariales con requisitos de implementación privatizados pueden realizar ajustes e implementación locales después de que los pesos sean de código abierto. Las personas que no son adecuadas para el uso inmediato son: usuarios comunes que solo necesitan preguntas y respuestas simples y redacción diaria (muchos modelos asequibles son suficientes); usuarios del entorno de producción que requieren una velocidad de respuesta extremadamente alta; desarrolladores individuales que no tienen suficiente presupuesto o recursos de GPU y el umbral para la autoimplementación es demasiado alto. En términos de recomendaciones de uso, puede adoptar una estrategia en capas: use K3 para el 15%-20% de las tareas complejas (programación de ciclo largo, agentes de múltiples pasos, análisis en profundidad de documentos largos) y use modelos más livianos como K2.7 Code o DeepSeek V4 Pro para tareas simples diarias de alta frecuencia. La optimización de las llamadas API basadas en estrategias de almacenamiento en caché también puede reducir significativamente los costos.
-
Kimi K3 es un producto emblemático. Permite que la etiqueta "modelo de código abierto" compita verdaderamente con los mejores modelos de código cerrado por primera vez. Sus avances en programación y tareas de largo alcance son reales y también han causado enormes repercusiones a nivel de industria y mercado. Pero en general sigue siendo un "jugador científico": se desempeña a la perfección en escenarios específicos, pero todavía hay una brecha en los escenarios generales. Es posible que su influencia real a largo plazo no resida en la cantidad de llamadas API actuales, sino en el hecho de que después de que el peso se abra oficialmente en unos días, servirá como modelo base para potenciar todo el ecosistema de IA.
Reseñas de usuarios
-
CarolynBakerJr—K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。 -
goldenlion904—用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。 -
Brjen—API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。 -
程彤云—实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。 -
KOgar—得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。 -
SandraHart168—同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。 -
游客_8—办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。 -
Madison_Hall_7—精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。 -
Karen836—K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。 -
月光_21—最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。 -
redzebra695—前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。 -
AbigailMitchell_2024—把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。 -
realSanjaSilić_dev—用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。 -
VEcoo—这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。 -
HashHunter114—API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。 -
Olivia.Brooks007—刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。 -
唐兰—2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。 -
Justin.Morales_99—蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。 -
DrErnestoMárquez_x—编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。 -
blPAR—有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。 -
Judy_Morales52014—开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。 -
Richard.RobertsX—用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。 -
胡勇丹—做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。 -
BCooper_2023—普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。 -
DanielleRamirez_668—马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。 -
VincentPerezZ—刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。 -
吴秀龙—月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。 -
MidhaelJensen—第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。