Kimi K3 オープンソース版

Moonshot AI(月之暗面)が公開した世界最大のオープンソース大規模モデル。2.8兆パラメータ、ネイティブなマルチモーダル対応と100万トークンの超長コンテキスト、コーディング能力は世界トップ

詳細レポート

  • 2026 年 7 月 16 日、Beijing Dark Side of the Moon Technology Co., Ltd. は、合計パラメータ規模が 2 兆 8,000 億の大規模なオープンソース モデルである Kimi K3 をリリースしました。これは現在、世界で最大のパラメータを持つオープンソース モデルです。これは、1679 ポイントで Frontend Code Arena フロントエンド プログラミング リストのトップとなり、Claude Fable 5 と GPT-5.6 Sol を上回りました。 K3 は、自社開発の KDA ハイブリッド リニア アテンション メカニズムとアテンション レジデュアル テクノロジーに基づいて構築されています。視覚的な理解をネイティブにサポートし、100 万トークンのコンテキスト ウィンドウを備えています。長期にわたるプログラミング、知識作業、詳細な調査、マルチモーダルな理解などの複雑なタスクのシナリオ向けに特に最適化されています。耐久性プログラミングとエージェント タスクでは最先端のパフォーマンスを示しますが、その全体的な包括的なインテリジェンスは依然として最強のクローズド ソース モデルに遅れをとっています。

  • Moonshot AI は 2023 年に設立され、北京に本社を置いています。アリババと香港投資管理有限公司(香港投資)が出資するAIスタートアップ企業です。創設者の楊志林氏は、以前は清華大学相互情報研究所の助教授を務めていました。チームの中心メンバーは、清華大学や北京大学などの一流大学や、Google や Meta などのテクノロジー企業の出身です。 Kim K3 は 1 年以上開発が進められており、Kim K2 (2025 年 7 月リリース) の正式な後継製品です。その間、K2.5、K2.6、K2.7 コードなどの反復バージョンもリリースされました。 K3 のリリースは、パラメータ スケールの質的飛躍 (K2 の 10 兆レベルから 2.8 兆レベルへの飛躍) を達成するだけでなく、基礎となるアーキテクチャに 3 つの重要な革新をもたらします。それは、KDA ハイブリッド線形アテンション メカニズム (キミ デルタ アテンション)、アテンション残差テクノロジー (アテンション残差)、および Moon Clip 二次オプティマイザです。 キミ K3 のリリースも業界に旋風を巻き起こしたことは注目に値します。ホワイトハウス科学技術政策局のマイケル・クラツィオス局長は、ソーシャルメディア上でダークサイド・オブ・ザ・ムーンがアンスロピックの寓話モデルを蒸留してK3を開発していると非難し、制裁と実体リストを脅迫し​​た。 OpenAIの戦略的将来責任者であるディーン・ボール氏も、OpenAIを「減速主義勢力」と呼んで公に批判した。 Dark Side of the Moon Enterprise ビジネスの責任者である Huang Zhenxin 氏は、K3 のパフォーマンス向上の核心は、基礎となるオリジナルのアーキテクチャ上の革新から来ており、既存のモデルの蒸留されたコピーではないと明確に答えました。多くの権威あるメディアやAI研究者も、この告発には技術的根拠がないと公に述べている。

  • Kim K3 のコア機能は、次の方向に重点を置いています。 1 つ目はプログラミング能力であり、これが最も期待されている分野です。 Frontend Code Arena のフロントエンド コード リストでは、K3 が 1679 ポイントで第 1 位にランクされ、Claude Fable 5 (1631 ポイント) と GPT-5.6 Sol (1618 ポイント) を上回っています。実際のプログラミング エクスペリエンスは 2 つのシナリオに分かれています。1 つは、/model コマンド切り替えをサポートし、長期間の継続的なプログラミング タスクに適した Kim Code ターミナル ツールを通じて使用されます。もう 1 つは Kim API を通じて呼び出され、OpenAI SDK と互換性があり、価格はキャッシュ ヒットの場合は 100 万トークンあたり 0.3 ドル、入力ミスの場合は 3 ドル、出力の場合は 15 ドルです。 2つ目は長距離タスク処理能力です。公式に実証された事例としては、チップ設計と最適化を連続 48 時間にわたって独立して完了したことや、計算天体物理学の分野で I-Love-Q の普遍的な関係を約 2 時間で再現したことが含まれます。 K3 は、長期間にわたるエンジニアリング タスクを継続的に完了し、大規模なコード ベースを理解して処理し、最小限の人間の監督でターミナル ツールの使用を調整できます。 3つ目は、マルチモーダルな理解能力です。 K3 は、画像とテキストのマルチモーダル入力をネイティブにサポートしています。これはプラグインのビジュアル エンコーダーではなく、真のネイティブのビジュアルな理解を提供します。これは、テキスト、画像、ビデオ入力を同時に処理できることを意味します。 API を使用するには 4 つの方法があります。 Kimi モバイル アプリ (iOS/Android/HarmonyOS) を通じて、無料で直接チャットできます。デスクトップ バージョンの Kimi Work 3.1.0 以降では、作業シーンのサポートが提供されます。 Kim Code ターミナル ツールはプログラマーを対象としています。 Kim API プラットフォームは、開発者と企業ユーザーを対象としています。公式では、データプライバシー保護や会員管理機能を提供する「Kimi Enterprise」エンタープライズ版も提供している。 実際のユーザーエクスペリエンスの観点から、フロントエンドの開発者やプログラマーは総じて高い評価をしており、K3 はフロントエンドのコード生成や UI 復元において「設計意図を正確に理解している」と考えています。しかし、一般ユーザーからのフィードバックは二極化されており、複雑な長文の解析は確かに優れていると感じる人もいれば、「日常会話では大きな違いはない」と不満を抱く人もいます。

  • Kimi K3 の API 価格は中国のヘッド モデルのハイエンドであり、生産高は 100 万トークンあたり 15 米ドルで、これは約 100 人民元に相当します。前世代の K2.6 は 4 ドルで、3 倍近く値上がりしました。同様の国内モデル GLM-5.2 の生産価格は 4.4 米ドルです。 ただし、公式が提供する重要なデータは、プログラミング シナリオではキャッシュ ヒット率が 90% を超える可能性があるため、実際の支出は表示価格よりもはるかに低いということです。キャッシュ ヒット入力のコストは、100 万トークンあたりわずか 0.3 ドルです。関係者によると、Mooncake の分離推論アーキテクチャに依存するこのシステムは、高頻度のプログラミング シナリオにおいて K3 のコスト効率を非常に高くします。 Dark Side of the Moon Enterprise Business の責任者である Huang Zhenxin 氏は、オープンソース モデルや中国製の大型モデルに低価格のレッテルを貼るべきではないと明言しました。 「私たちは、リーズナブルな商用価格にも対応できる SOTA レベルのモデルを構築しました。」 Artificial Analysis の計算によると、Kimi K3 のシングルタスク コストは約 0.94 米ドルで、GPT-5.6 Sol の 1.04 米ドルに近いです。表面的に見えるよりもそれほど安いわけではありません。 消費者側では、Kimi の無料版には特定の K3 割り当てが含まれており、有料メンバーシップは複数の段階に分かれており、最大 699 元/月です。一部のユーザーは、1 日で割り当て量の 20% が使用されたと報告しており、ヘビー ユーザーのコストは無視できないことを意味します。 Dark Side of the Moon は、オープンソース路線を堅持すると述べている。修正された MIT ライセンスに基づいて、2026 年 7 月 27 日より前にリリースされた完全なモデルの重み。プライベートな導入と微調整のニーズがある企業顧客にとって、オープンソースは価値の高いオプションです。

  • 肯定的なコメントは主に 3 つの側面に焦点を当てています。まず、プログラミング シナリオの経験が優れており、フロントエンド コード生成の品質が高く、設計意図が正確に理解されています。ヴァーセル創設者ギレルモ・ラウフ氏も実際にテストと検証を行った。次に、長文や長いタスクの処理能力が優れています。ユーザーは、数十ページの文書を要約にまとめる際に、K3 が重要な情報を正確に抽出し、積極的に差し引いて「判断力が向上し始めた」と報告しました。第三に、専門的なシナリオ (財務分析、契約レビュー、業界調査) における自動化機能は満足のいくものです。一部のユーザーは、契約に隠された自動更新条項を見つけるためにこれを使用しています。 否定的なレビューも目立ちます。最も一般的な苦情は応答速度の遅さです。同様のタスクである Claude Fable 5 では 3.5 分かかりましたが、K3 では 12 分かかりました。 API の応答性はカテゴリの平均を下回っています。第二に、価格が高めです。 K2.6 から K3 まで、生産価格は 3 倍近く上昇しました。ここでもまた、「過剰な理由付け」の問題があります。一部のユーザーは、K3 が漠然とした意図で独自にタスクの範囲を拡大し、手戻りコストが増加すると報告しています。日常の明るいシーンでは大きな改善が感じられないというユーザーのフィードバックもあります。

  • 業界メディアは概してそれを高く評価しました。経済日報はこれを、中国の大型モデルが価格決定力を目指す新たな結節点と解釈した。ゴールドマン・サックスの調査報告書によると、中国の大型モデルはこれまで主にコストパフォーマンスに基づいて世界市場に参入してきたが、将来的には最先端の機能に頼って世界の開発者の中核的なワークフローに参入する可能性があるという。モルガン・スタンレーは、Kimi K3のAPI価格が中国のトップモデルの中で高水準にあることを懸念しており、価格上昇は大型モデルの市場構造にとってプラスの意味を持つと考えている。 テクノロジーコミュニティは分裂している。一部の開発者は、フロントエンドコード競争においてオープンソースモデルがすべてのクローズドソースモデルを完全に上回ったのは初めてであるため、これが「プログラミング分野におけるオープンソースモデルの転換点」であると信じている。また、Benchmark は Benchmark のものであり、実際の使用における「遅さと高価さ」は避けられない客観的なコストであると考える人もいます。一部の業界専門家はまた、K3 の真の価値は経営陣側で体験されるだけでなく、多くの中小企業に力を与える基本モデルとして機能すると指摘しました。モデルの重みがオープンソース化されると、多くの国内企業は大規模なモデルを最初からトレーニングする必要がなくなりました。 資本市場に関しては、オープンソースの最先端モデルがクローズドソースの価格設定能力に影響を与える可能性があるという投資家の懸念を反映して、米国のAI株はK3のリリース後に下落の波が見られた。 Elon Musk は、関連コメントに「印象的」という 2 つのコメントを残し、Grok 4.6 の主要なターゲットとして K3 を挙げました。

  • 蒸留装入量が主な論争となった。ホワイトハウスは直接この告発を行ったが、技術専門家は一般的にこの告発は容認できないと考えている。アメリカのAI技術専門家ネイサン・ランバート氏は、中国のAI研究所が知的財産を盗むだけで優れたモデルを生み出すことができると信じている人々は「目覚める時が来た」と公に書いた。 OpenAI の将来戦略責任者である Dean Ball 氏も、物議を醸している投稿の中で、K3 のパフォーマンスは蒸留によっては達成できないことを認めました。 技術的なリスクという点では、モデルの推論速度が遅いことが現時点で最も顕著な欠点です。高速な応答時間を必要とする実稼働環境の場合、K3 は最良の選択ではない可能性があります。さらに、このモデルには「過度に理由づける」傾向があり、明示的な指示なしにタスクの範囲を積極的に拡大する傾向があるため、厳密な境界制御が必要なシナリオではリスクが生じます。 コンプライアンスとデータセキュリティに関しては現実的な問題があります。 Kimi のホスティング サービスのデータは中国国内で処理されるため、データの輸出制限がある海外ユーザーにとっては、これが重要な考慮事項となります。オープンソースの重みはリリース後にローカルにデプロイできますが、2.8 兆パラメータ モデルのデプロイしきい値は非常に高く、公式推奨は 64 アクセラレータを超えるスーパーノード構成であり、一般の企業や個人には基本的に手が届きません。 モデル錯視の問題も完全には解決されていない。黄振新自身も「幻覚を完全に根絶することはできない」と認めた。ただし、K3 ではその発生率が大幅に減少しており、二次検証のために Agent Swarm アーキテクチャ内のファクト チェッカー サブエージェントが必要です。

  • Kimi K3 の使用に適している人は次のとおりです。フロントエンド開発者とフルスタック エンジニア、特に複雑な UI 開発とフロントエンド エンジニアリングに従事するチーム。長期にわたる自動プログラミングを必要とする AI エージェントのエンジニアおよび研究者。非常に大規模なドキュメントを扱い、長期にわたる詳細な調査シナリオを実行する金融アナリスト、業界研究者、科学研究者。民営化された展開要件を持つ企業顧客は、重みがオープンソース化された後、ローカルでの微調整と展開を実行できます。 すぐに使用するのに適さない人は次のとおりです。日常の簡単な Q&A とコピーライティングのみが必要な一般ユーザー (多くの手頃なモデルで十分です)。非常に高い応答速度を必要とする本番環境のユーザー。十分な予算や GPU リソースがなく、自己展開の敷居が高すぎる個人開発者。 使用上の推奨事項に関しては、階層化された戦略を採用できます。複雑なタスク (長期サイクルのプログラミング、マルチステップ エージェント、長いドキュメントの詳細な分析) の 15% ~ 20% には K3 を使用し、毎日の高頻度の単純なタスクには K2.7 コードや DeepSeek V4 Pro などの軽量モデルを使用します。キャッシュ戦略に基づいて API 呼び出しを最適化すると、コストも大幅に削減できます。

  • キミ K3 は画期的な製品です。これにより、「オープンソース モデル」というラベルが、トップのクローズド ソース モデルと初めて真に競合できるようになります。プログラミングと長距離タスクにおける画期的な進歩は本物であり、業界および市場レベルで大きな反響も引き起こしています。しかし、全体としては依然として「科学プレーヤー」であり、特定のシナリオでは一流のパフォーマンスを発揮しますが、一般的なシナリオではまだギャップがあります。その本当の長期的な影響は、今日の API 呼び出しの数にあるのではなく、数日以内にウェイトが正式にオープンソース化された後、AI エコシステム全体を強化する基本モデルとして機能するという事実にあるかもしれません。

ユーザーレビュー

  • アイコン
    CarolynBakerJr
    K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。

  • アイコン
    goldenlion904
    用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。

  • アイコン
    Brjen
    API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。

  • アイコン
    程彤云
    实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。

  • アイコン
    KOgar
    得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。

  • アイコン
    SandraHart168
    同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。

  • アイコン
    游客_8
    办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。

  • アイコン
    Madison_Hall_7
    精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。

  • アイコン
    Karen836
    K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。

  • アイコン
    月光_21
    最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。

  • アイコン
    redzebra695
    前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。

  • アイコン
    AbigailMitchell_2024
    把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。

  • アイコン
    realSanjaSilić_dev
    用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。

  • アイコン
    VEcoo
    这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。

  • アイコン
    HashHunter114
    API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。

  • アイコン
    Olivia.Brooks007
    刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。

  • アイコン
    唐兰
    2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。

  • アイコン
    Justin.Morales_99
    蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。

  • アイコン
    DrErnestoMárquez_x
    编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。

  • アイコン
    blPAR
    有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。

  • アイコン
    Judy_Morales52014
    开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。

  • アイコン
    Richard.RobertsX
    用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。

  • アイコン
    胡勇丹
    做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。

  • アイコン
    BCooper_2023
    普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。

  • アイコン
    DanielleRamirez_668
    马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。

  • アイコン
    VincentPerezZ
    刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。

  • アイコン
    吴秀龙
    月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。

  • アイコン
    MidhaelJensen
    第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。