Kimi K3 Open-Source-Edition

Das größte Open-Source-Sprachmodell der Welt von Moonshot AI: 2,8 Billionen Parameter, native Multimodalität und 1 Million Token Kontext, weltweit führend beim Programmieren

Ausführlicher Bericht

  • Am 16. Juli 2026 veröffentlichte Beijing Dark Side of the Moon Technology Co., Ltd. Kimi K3, ein großes Open-Source-Modell mit einer Gesamtparameterskala von 2,8 Billionen. Dies ist derzeit das Open-Source-Modell mit den größten Parametern weltweit. Mit 1679 Punkten führte es die Frontend-Programmierliste der Frontend Code Arena an und übertraf damit Claude Fable 5 und GPT-5.6 Sol. K3 basiert auf dem selbst entwickelten KDA-Hybrid-Linear-Aufmerksamkeitsmechanismus und der Aufmerksamkeitsresttechnologie. Es unterstützt nativ das visuelle Verständnis und verfügt über ein Kontextfenster mit 1 Million Token. Es ist speziell für komplexe Aufgabenszenarien wie Fernprogrammierung, Wissensarbeit, tiefgreifende Recherche und multimodales Verständnis optimiert. Es zeigt Spitzenleistung bei Ausdauerprogrammierung und Agentenaufgaben, aber seine umfassende Gesamtintelligenz bleibt immer noch hinter den stärksten Closed-Source-Modellen zurück.

  • Moonshot AI wurde 2023 gegründet und hat seinen Hauptsitz in Peking. Es handelt sich um ein KI-Startup-Unternehmen, das von Alibaba und Hong Kong Investment Management Co., Ltd. (Hong Kong Investment) investiert wird. Der Gründer, Yang Zhilin, war zuvor Assistenzprofessor am Institut für Cross-Information der Tsinghua-Universität. Die Kernmitglieder des Teams kommen von Spitzenuniversitäten wie der Tsinghua- und der Peking-Universität sowie Technologieunternehmen wie Google und Meta. Kimi K3 befindet sich seit über einem Jahr in der Entwicklung und ist der offizielle Nachfolger von Kimi K2 (veröffentlicht im Juli 2025). Inzwischen wurden auch iterative Versionen wie K2.5, K2.6 und K2.7 Code veröffentlicht. Mit der Veröffentlichung von K3 wird nicht nur ein qualitativer Sprung in der Parameterskala erreicht – der Sprung vom Billionenniveau von K2 auf 2,8 Billionen –, sondern es werden auch drei wichtige Neuerungen in der zugrunde liegenden Architektur vorgenommen: der hybride lineare Aufmerksamkeitsmechanismus KDA (Kimi Delta Attention), die Aufmerksamkeitsresttechnologie (Attention Residuals) und der Optimierer zweiter Ordnung Moon Clip. Es ist erwähnenswert, dass die Veröffentlichung von Kimi K3 auch einen Branchensturm auslöste. Michael Kratzios, Direktor des Büros für Wissenschafts- und Technologiepolitik des Weißen Hauses, beschuldigte Dark Side of the Moon, K3 durch Destillation des Fable-Modells von Anthropic in den sozialen Medien entwickelt zu haben, und drohte mit Sanktionen und einer Entitätsliste. Dean Ball, OpenAIs Leiter für strategische Zukunft, kritisierte es ebenfalls öffentlich und nannte es eine „Entschleunigungskraft“. Huang Zhenxin, Leiter des Dark Side of the Moon Enterprise-Geschäfts, antwortete klar, dass der Kern des Leistungssprungs von K3 auf der zugrunde liegenden ursprünglichen architektonischen Innovation beruht und keine destillierte Kopie des bestehenden Modells ist. Viele maßgebliche Medien- und KI-Forscher erklärten außerdem öffentlich, dass die Anschuldigung keine technische Grundlage habe.

  • Die Kernkompetenzen von Kimi K3 konzentrieren sich auf die folgenden Richtungen. Der erste Bereich ist die Programmierfähigkeit, der vielversprechendste Bereich. In der Frontend-Codeliste der Frontend Code Arena belegt K3 mit 1679 Punkten den ersten Platz und übertrifft Claude Fable 5 (1631 Punkte) und GPT-5.6 Sol (1618 Punkte). Die eigentliche Programmiererfahrung ist in zwei Szenarien unterteilt: Eines wird über das Kimi Code-Terminal-Tool verwendet, das die Befehlsumschaltung / model unterstützt und für langfristige kontinuierliche Programmieraufgaben geeignet ist. der andere wird über die Kimi-API aufgerufen, die mit dem OpenAI SDK kompatibel ist und einen Preis von 0,3 US-Dollar pro Million Token für Cache-Treffer, 3 US-Dollar für Eingabefehler und 15 US-Dollar für die Ausgabe hat. Die zweite Möglichkeit besteht in der Fähigkeit, Aufgaben über große Entfernungen zu bearbeiten. Offiziell demonstrierte Fälle umfassen die unabhängige Durchführung von Chipdesign und -optimierung für 48 aufeinanderfolgende Stunden und die Reproduktion der universellen I-Love-Q-Beziehung im Bereich der Computerastrophysik in etwa zwei Stunden. K3 kann kontinuierlich langfristige technische Aufgaben erledigen, große Codebasen verstehen und verarbeiten und die Verwendung von Terminal-Tools mit minimaler menschlicher Aufsicht koordinieren. Das dritte sind multimodale Verständnisfähigkeiten. K3 unterstützt nativ die multimodale Eingabe von Bildern und Text. Es handelt sich nicht um einen visuellen Plug-in-Encoder, sondern um ein echtes natives visuelles Verständnis. Dies bedeutet, dass Text-, Bild- und Videoeingaben gleichzeitig verarbeitet werden können. Es gibt vier Möglichkeiten, die API zu verwenden. Chatten Sie direkt und kostenlos über die mobile Kimi-App (iOS/Android/HarmonyOS). Die Desktop-Version von Kimi Work 3.1.0 und höher bietet Unterstützung für Arbeitsszenen. Das Terminal-Tool Kimi Code richtet sich an Programmierer. Die Kimi-API-Plattform richtet sich an Entwickler und Unternehmensanwender. Der Beamte stellt auch die Unternehmensversion Kimi Enterprise bereit, die Datenschutz- und Mitgliederverwaltungsfunktionen bietet. Aus Sicht der tatsächlichen Benutzererfahrung geben Front-End-Entwickler und Programmierer im Allgemeinen gute Bewertungen ab und glauben, dass K3 bei der Front-End-Codegenerierung und UI-Wiederherstellung „die Designabsicht genau versteht“. Das Feedback normaler Benutzer ist jedoch gespalten – einige sind der Meinung, dass es tatsächlich besser darin sei, komplexe lange Texte zu analysieren, während andere sich darüber beschweren, dass „es bei alltäglichen Gesprächen keinen großen Unterschied gibt“.

  • Die API-Preise von Kimi K3 liegen am oberen Ende der chinesischen Hauptmodelle – die Produktion beträgt 15 US-Dollar pro Million Token, was etwa 100 RMB entspricht. Die vorherige Generation K2.6 kostet 4 US-Dollar, was einer Steigerung um fast das Dreifache entspricht. Der Verkaufspreis des ähnlichen inländischen Modells GLM-5.2 beträgt 4,4 US-Dollar. Eine wichtige Angabe des Beamten lautet jedoch: In Programmierszenarien kann die Cache-Trefferquote 90 % überschreiten, sodass der tatsächliche Aufwand weit unter dem angegebenen Preis liegt. Die Cache-Treffer-Eingabe kostet nur 0,3 US-Dollar pro Million Token. Laut offiziellen Angaben macht dieses System, das auf der separaten Argumentationsarchitektur von Mooncake basiert, K3 in Hochfrequenz-Programmierszenarien äußerst kosteneffektiv. Huang Zhenxin, Leiter von Dark Side of the Moon Enterprise Business, machte deutlich, dass Open-Source-Modelle und große chinesische Modelle nicht als niedrigpreisig abgestempelt werden sollten. „Wir haben ein Modell auf SOTA-Ebene entwickelt, das auch zu angemessenen kommerziellen Preisen passt.“ Die Berechnungen von Artificial Analysis zeigen, dass die Kosten für eine einzelne Aufgabe von Kimi K3 etwa 0,94 US-Dollar betragen, was nahe an den 1,04 US-Dollar von GPT-5.6 Sol liegt. Es ist nicht viel billiger, als es auf den ersten Blick scheint. Auf Verbraucherseite beinhaltet die kostenlose Version von Kimi ein bestimmtes K3-Kontingent und die kostenpflichtige Mitgliedschaft ist in mehrere Stufen unterteilt, bis zu 699 Yuan/Monat. Einige Benutzer berichteten, dass 20 % ihres Kontingents an einem Tag genutzt wurden, was bedeutet, dass die Kosten für Vielbenutzer nicht zu vernachlässigen sind. Dark Side of the Moon sagt, dass es an der Open-Source-Route festhalten wird. Vollständige Modellgewichte, die vor dem 27. Juli 2026 unter einer modifizierten MIT-Lizenz veröffentlicht wurden. Für Unternehmenskunden mit privatem Bereitstellungs- und Feinabstimmungsbedarf ist Open Source eine hochwertige Option.

  • Positive Kommentare konzentrieren sich hauptsächlich auf drei Aspekte. Erstens ist die Erfahrung mit Programmierszenarien ausgezeichnet, die Front-End-Codegenerierung ist von hoher Qualität und die Entwurfsabsicht ist genau verstanden. Vercel-Gründer Guillermo Rauch hat auch tatsächliche Tests und Verifizierungen durchgeführt. Zweitens ist seine Fähigkeit, lange Texte und lange Aufgaben zu verarbeiten, herausragend. Benutzer berichteten, dass K3 beim Zusammenfassen von Dutzenden von Dokumentseiten in einer Zusammenfassung wichtige Informationen genau extrahieren, proaktiv subtrahieren und „ein besseres Urteilsvermögen erlangen“ könne. Drittens sind die Automatisierungsmöglichkeiten in professionellen Szenarien (Finanzanalyse, Vertragsprüfung, Branchenforschung) zufriedenstellend. Einige Benutzer haben damit versteckte Klauseln zur automatischen Verlängerung in Verträgen gefunden. Auch negative Bewertungen fallen auf. Die häufigste Beschwerde ist die langsame Reaktionsgeschwindigkeit – eine ähnliche Aufgabe, Claude Fable 5, dauerte 3,5 Minuten, während K3 12 Minuten dauerte. Die API-Reaktionsfähigkeit liegt unter dem Kategoriedurchschnitt. Zweitens sind die Preise recht hoch. Von K2,6 auf K3 hat sich der Produktionspreis fast verdreifacht. Auch hier besteht das Problem der „Überbegründung“. Einige Anwender berichten, dass K3 von sich aus mit vagen Absichten den Aufgabenumfang erweitert und damit den Nacharbeitsaufwand erhöht. Es gibt auch Rückmeldungen von Nutzern, dass in täglichen Lichtszenarien keine signifikante Verbesserung zu spüren sei.

  • Die Branchenmedien äußerten sich allgemein positiv darüber. Die Economic Daily interpretierte dies als einen neuen Knotenpunkt für Chinas große Modelle, um sich in Richtung Preissetzungsmacht zu bewegen. Ein Forschungsbericht von Goldman Sachs geht davon aus, dass Chinas große Modelle bisher hauptsächlich auf der Grundlage der Kostenleistung in den Weltmarkt eingetreten sind und in Zukunft möglicherweise auf modernste Fähigkeiten angewiesen sind, um in den Kernarbeitsablauf globaler Entwickler einzusteigen. Morgan Stanley ist besorgt darüber, dass der API-Preis des Kimi K3 unter den Topmodellen Chinas auf einem hohen Niveau liegt, und glaubt, dass höhere Preise eine positive Bedeutung für die Marktstruktur großer Modelle haben. Die Tech-Community ist gespalten. Einige Entwickler halten es für „einen Wendepunkt für das Open-Source-Modell im Bereich der Programmierung“, da es das erste Mal ist, dass ein Open-Source-Modell alle Closed-Source-Modelle im Front-End-Code-Wettbewerb vollständig überholt hat. Andere glauben, dass Benchmark zu Benchmark gehört und dass die „Langsamkeit und Kosten“ bei der tatsächlichen Nutzung unvermeidbare objektive Kosten sind. Einige Branchenexperten wiesen auch darauf hin, dass der wahre Wert von K3 nicht nur auf der C-Seite zu spüren sei, sondern dass es als Basismodell für die Stärkung einer großen Zahl kleiner und mittlerer Unternehmen dienen werde. Nachdem die Modellgewichte als Open Source verfügbar sind, müssen viele inländische Unternehmen große Modelle nicht mehr von Grund auf trainieren. Auf den Kapitalmärkten erlebten US-amerikanische KI-Aktien nach der Veröffentlichung von K3 eine Welle von Rückgängen, was die Besorgnis der Anleger widerspiegelte, dass hochmoderne Open-Source-Modelle die Preisgestaltungsfähigkeiten von Closed-Source-Modellen beeinträchtigen könnten. Elon Musk hinterließ in verwandten Kommentaren zwei Kommentare zum Thema „beeindruckend“ und nannte K3 als Hauptziel für Grok 4.6.

  • Die Destillationsgebühr war die Hauptkontroverse. Das Weiße Haus hat den Vorwurf direkt erhoben, technische Experten sind jedoch im Allgemeinen der Ansicht, dass dieser Vorwurf unhaltbar ist. Der amerikanische KI-Technologieexperte Nathan Lambert schrieb öffentlich, dass Menschen, die glauben, dass chinesische KI-Labore einfach durch den Diebstahl geistigen Eigentums hervorragende Modelle produzieren können, „es Zeit ist, aufzuwachen.“ Dean Ball, Leiter der strategischen Zukunft bei OpenAI, gab in dem umstrittenen Beitrag auch zu, dass die K3-Leistung nicht durch Destillation erreicht werden kann. Hinsichtlich der technischen Risiken ist die langsame Inferenzgeschwindigkeit des Modells derzeit das größte Manko. Für Produktionsumgebungen, die schnelle Reaktionszeiten erfordern, ist K3 möglicherweise nicht die beste Wahl. Darüber hinaus neigt das Modell zu „übertriebenen Überlegungen“ und neigt dazu, den Aufgabenumfang ohne explizite Anweisungen proaktiv zu erweitern, was in Szenarien, die eine strenge Grenzkontrolle erfordern, Risiken birgt. Es gibt echte Probleme im Zusammenhang mit Compliance und Datensicherheit. Die Daten im Hosting-Service von Kimi werden innerhalb Chinas verarbeitet, was für ausländische Benutzer mit Datenexportbeschränkungen ein wichtiger Gesichtspunkt ist. Obwohl die Open-Source-Gewichte nach der Veröffentlichung lokal bereitgestellt werden können, ist die Bereitstellungsschwelle des 2,8-Billionen-Parameter-Modells extrem hoch – die offizielle Empfehlung ist eine Superknotenkonfiguration mit mehr als 64 Beschleunigern, was für normale Unternehmen und Einzelpersonen grundsätzlich unerschwinglich ist. Auch das Problem der Modellillusion ist noch nicht vollständig gelöst. Huang Zhenxin selbst gab zu, dass „Halluzinationen nicht vollständig ausgerottet werden können“. Allerdings hat K3 seine Inzidenz erheblich reduziert und erfordert für die sekundäre Überprüfung den Faktenprüfer-Subagenten in der Agent Swarm-Architektur.

  • Personen, die für die Verwendung von Kimi K3 geeignet sind, sind: Front-End-Entwickler und Full-Stack-Ingenieure, insbesondere Teams, die sich mit komplexer UI-Entwicklung und Front-End-Engineering befassen; KI-Agent-Ingenieure und -Forscher, die eine langfristige automatisierte Programmierung benötigen; Finanzanalysten, Branchenforscher und wissenschaftliche Forscher, die sich mit sehr großen Dokumenten befassen und langfristige, tiefgreifende Forschungsszenarien durchführen; Unternehmenskunden mit privatisierten Bereitstellungsanforderungen können eine lokale Feinabstimmung und Bereitstellung durchführen, nachdem die Gewichte als Open Source bereitgestellt wurden. Personen, die nicht für den sofortigen Gebrauch geeignet sind, sind: normale Benutzer, die nur täglich einfache Fragen und Antworten und Texterstellung benötigen (viele erschwingliche Modelle reichen aus); Benutzer in Produktionsumgebungen, die eine extrem hohe Reaktionsgeschwindigkeit benötigen; einzelne Entwickler, die nicht über genügend Budget oder GPU-Ressourcen verfügen und deren Schwelle für eine Selbstbereitstellung zu hoch ist. Was die Nutzungsempfehlungen angeht, können Sie eine mehrschichtige Strategie verfolgen: Verwenden Sie K3 für 15–20 % der komplexen Aufgaben (Langzeitprogrammierung, mehrstufige Agenten, eingehende Analyse langer Dokumente) und verwenden Sie einfachere Modelle wie K2.7 Code oder DeepSeek V4 Pro für tägliche, hochfrequente einfache Aufgaben. Auch die Optimierung von API-Aufrufen auf Basis von Caching-Strategien kann die Kosten deutlich senken.

  • Kimi K3 ist ein bahnbrechendes Produkt. Dadurch kann die Bezeichnung „Open-Source-Modell“ erstmals wirklich mit Top-Closed-Source-Modellen konkurrieren. Seine Durchbrüche bei der Programmierung und bei Langstreckenaufgaben sind real und haben auch enorme Auswirkungen auf Branchen- und Marktebene verursacht. Aber im Großen und Ganzen handelt es sich immer noch um einen „wissenschaftlichen Spieler“ – er schneidet in bestimmten Szenarien erstklassig ab, bei allgemeinen Szenarien gibt es jedoch immer noch eine Lücke. Sein wirklicher langfristiger Einfluss liegt möglicherweise nicht in der Anzahl der heutigen API-Aufrufe, sondern in der Tatsache, dass das Gewicht, nachdem es in wenigen Tagen offiziell als Open Source verfügbar ist, als Basismodell zur Stärkung des gesamten KI-Ökosystems dienen wird.

Nutzerbewertungen

  • Avatar
    CarolynBakerJr
    K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。

  • Avatar
    goldenlion904
    用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。

  • Avatar
    Brjen
    API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。

  • Avatar
    程彤云
    实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。

  • Avatar
    KOgar
    得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。

  • Avatar
    SandraHart168
    同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。

  • Avatar
    游客_8
    办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。

  • Avatar
    Madison_Hall_7
    精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。

  • Avatar
    Karen836
    K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。

  • Avatar
    月光_21
    最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。

  • Avatar
    redzebra695
    前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。

  • Avatar
    AbigailMitchell_2024
    把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。

  • Avatar
    realSanjaSilić_dev
    用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。

  • Avatar
    VEcoo
    这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。

  • Avatar
    HashHunter114
    API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。

  • Avatar
    Olivia.Brooks007
    刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。

  • Avatar
    唐兰
    2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。

  • Avatar
    Justin.Morales_99
    蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。

  • Avatar
    DrErnestoMárquez_x
    编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。

  • Avatar
    blPAR
    有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。

  • Avatar
    Judy_Morales52014
    开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。

  • Avatar
    Richard.RobertsX
    用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。

  • Avatar
    胡勇丹
    做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。

  • Avatar
    BCooper_2023
    普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。

  • Avatar
    DanielleRamirez_668
    马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。

  • Avatar
    VincentPerezZ
    刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。

  • Avatar
    吴秀龙
    月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。

  • Avatar
    MidhaelJensen
    第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。