Kimi K3 edisi open source

Model bahasa open source terbesar di dunia dari Moonshot AI: 2,8 triliun parameter, multimodal native, dan konteks super panjang 1 juta token, kemampuan coding nomor satu dunia

Laporan mendalam

  • Pada 16 Juli 2026, Beijing Dark Side of the Moon Technology Co., Ltd. merilis Kimi K3, model sumber terbuka besar dengan skala parameter total 2,8 triliun. Saat ini model open source dengan parameter terbesar di dunia. Itu menduduki puncak daftar pemrograman front-end Frontend Code Arena dengan 1679 poin, melampaui Claude Fable 5 dan GPT-5.6 Sol. K3 dibangun berdasarkan mekanisme perhatian linier hibrida KDA yang dikembangkan sendiri dan teknologi sisa perhatian. Ini secara asli mendukung pemahaman visual dan memiliki jendela konteks 1 juta token. Ini secara khusus dioptimalkan untuk skenario tugas yang kompleks seperti pemrograman jarak jauh, pekerjaan pengetahuan, penelitian mendalam dan pemahaman multi-modal. Ini menunjukkan kinerja mutakhir dalam pemrograman ketahanan dan tugas agen, namun kecerdasan komprehensifnya secara keseluruhan masih tertinggal dibandingkan model sumber tertutup terkuat.

  • Moonshot AI didirikan pada tahun 2023 dan berkantor pusat di Beijing. Ini adalah perusahaan startup AI yang diinvestasikan oleh Alibaba dan Hong Kong Investment Management Co., Ltd. (Hong Kong Investment). Pendirinya, Yang Zhilin, sebelumnya adalah asisten profesor di Institut Lintas Informasi di Universitas Tsinghua. Anggota inti tim berasal dari universitas ternama seperti Tsinghua dan Universitas Peking serta perusahaan teknologi seperti Google dan Meta. Kimi K3 telah dikembangkan selama lebih dari setahun dan merupakan penerus resmi Kimi K2 (dirilis pada Juli 2025). Sementara itu, versi berulang seperti K2.5, K2.6, dan K2.7 Code juga dirilis. Peluncuran K3 tidak hanya mencapai lompatan kualitatif dalam skala parameter - melonjak dari level triliun K2 menjadi 2,8 triliun - namun juga membuat tiga inovasi utama dalam arsitektur yang mendasarinya: mekanisme perhatian linier hibrida KDA (Kimi Delta Attention), teknologi sisa perhatian (Attention Residuals) dan pengoptimal orde kedua Moon Clip. Perlu dicatat bahwa peluncuran Kimi K3 juga menyebabkan badai industri. Michael Kratzios, direktur Kantor Kebijakan Sains dan Teknologi Gedung Putih, menuduh Sisi Gelap Bulan mengembangkan K3 dengan menyaring model Fable Anthropic di media sosial, dan mengancam sanksi serta daftar entitas. Dean Ball, kepala masa depan strategis OpenAI, juga secara terbuka mengkritiknya, menyebutnya sebagai "kekuatan perlambatan." Huang Zhenxin, kepala bisnis Dark Side of the Moon Enterprise, menjawab dengan jelas bahwa inti dari lompatan kinerja K3 berasal dari inovasi arsitektur asli yang mendasarinya dan bukan salinan murni dari model yang sudah ada. Banyak media terkemuka dan peneliti AI juga secara terbuka menyatakan bahwa tuduhan tersebut tidak memiliki dasar teknis.

  • Kemampuan inti Kimi K3 fokus pada arah berikut. Yang pertama adalah kemampuan pemrograman, yang merupakan bidang yang paling menjanjikan. Pada daftar kode front-end Frontend Code Arena, K3 menempati peringkat pertama dengan 1679 poin, mengungguli Claude Fable 5 (1631 poin) dan GPT-5.6 Sol (1618 poin). Pengalaman pemrograman sebenarnya dibagi menjadi dua skenario: satu digunakan melalui alat terminal Kimi Code, yang mendukung peralihan perintah /model, dan cocok untuk tugas pemrograman berkelanjutan jangka panjang; yang lainnya dipanggil melalui Kimi API, yang kompatibel dengan OpenAI SDK dan dihargai $0,3 per juta token untuk cache hits, $3 untuk input yang salah, dan $15 untuk output. Yang kedua adalah kemampuan pemrosesan tugas jarak jauh. Kasus yang didemonstrasikan secara resmi termasuk menyelesaikan desain dan pengoptimalan chip secara mandiri selama 48 jam berturut-turut, dan mereproduksi hubungan universal I-Love-Q di bidang astrofisika komputasi dalam waktu sekitar dua jam. K3 dapat terus menyelesaikan tugas teknik jangka panjang, memahami dan memproses basis kode yang besar, dan mengoordinasikan penggunaan alat terminal dengan pengawasan manusia yang minimal. Yang ketiga adalah kemampuan pemahaman multi-modal. K3 secara asli mendukung input multi-modal gambar dan teks. Ini bukan encoder visual plug-in, tetapi pemahaman visual asli yang sebenarnya. Artinya dapat menangani input teks, gambar dan video secara bersamaan. Ada empat cara untuk menggunakan API. Ngobrol langsung dan gratis melalui aplikasi seluler Kimi (iOS/Android/HarmonyOS). Versi desktop Kimi Work 3.1.0 dan yang lebih baru menyediakan dukungan lingkungan kerja. Alat terminal Kimi Code ditujukan untuk pemrogram. Platform Kimi API ditujukan untuk pengembang dan pengguna perusahaan. Pejabat tersebut juga menyediakan versi perusahaan Kimi Enterprise, yang menyediakan fungsi perlindungan privasi data dan manajemen anggota. Dari perspektif pengalaman pengguna sebenarnya, pengembang dan pemrogram front-end umumnya memberikan penilaian tinggi dan percaya bahwa K3 "memahami maksud desain secara akurat" dalam pembuatan kode front-end dan restorasi UI. Namun, masukan dari pengguna biasa terpolarisasi - beberapa orang merasa bahwa ini memang lebih baik dalam menganalisis teks panjang yang rumit, sementara yang lain mengeluh bahwa "tidak ada perbedaan besar dalam percakapan sehari-hari."

  • Harga API Kimi K3 termasuk yang tertinggi di antara model utama Tiongkok – outputnya adalah US$15 per juta token, yaitu sekitar RMB 100. K2.6 generasi sebelumnya adalah $4, yang telah meningkat hampir 3 kali lipat. Harga keluaran model domestik serupa GLM-5.2 adalah US$4,4. Namun, data penting yang diberikan oleh pejabat tersebut adalah: dalam skenario pemrograman, tingkat cache hit bisa melebihi 90%, sehingga pengeluaran sebenarnya jauh lebih rendah dari harga yang tercantum. Biaya input cache hit hanya $0,3 per juta token. Menurut para pejabat, sistem yang mengandalkan arsitektur penalaran terpisah Mooncake ini menjadikan K3 sangat hemat biaya dalam skenario pemrograman frekuensi tinggi. Huang Zhenxin, kepala Dark Side of the Moon Enterprise Business, menjelaskan bahwa model open source dan model besar Tiongkok tidak boleh diberi label sebagai model dengan harga rendah. “Kami telah membangun model tingkat SOTA yang juga dapat menandingi harga komersial yang wajar.” Perhitungan Analisis Buatan menunjukkan bahwa biaya tugas tunggal Kimi K3 adalah sekitar US$0,94, yang mendekati US$1,04 dari GPT-5.6 Sol. Harganya tidak jauh lebih murah daripada yang terlihat di permukaan. Di sisi konsumen, Kimi versi gratis mencakup kuota K3 tertentu, dan keanggotaan berbayar dibagi menjadi beberapa tingkatan, hingga 699 yuan/bulan. Beberapa pengguna melaporkan bahwa 20% kuota mereka terpakai dalam satu hari, yang berarti biaya untuk pengguna berat tidak dapat diabaikan. Dark Side of the Moon mengatakan akan tetap menggunakan rute open source. Bobot model lengkap dirilis sebelum 27 Juli 2026, di bawah lisensi MIT yang dimodifikasi. Untuk pelanggan perusahaan dengan penerapan pribadi dan kebutuhan penyesuaian, open source adalah pilihan bernilai tinggi.

  • Komentar positif terutama berfokus pada tiga aspek. Pertama, pengalaman dalam skenario pemrograman sangat bagus, pembuatan kode front-end berkualitas tinggi, dan maksud desain dipahami secara akurat. Pendiri Vercel Guillermo Rauch juga telah melakukan pengujian dan verifikasi sebenarnya. Kedua, kemampuannya memproses teks yang panjang dan tugas yang panjang sangat luar biasa. Pengguna melaporkan bahwa ketika memasukkan puluhan halaman dokumen ke dalam ringkasan, K3 dapat secara akurat mengekstrak informasi penting, mengurangi secara proaktif, dan "mulai memiliki penilaian yang lebih baik." Ketiga, kemampuan otomasi dalam skenario profesional (analisis keuangan, tinjauan kontrak, riset industri) memuaskan. Beberapa pengguna telah menggunakannya untuk menemukan klausul perpanjangan otomatis yang tersembunyi dalam kontrak. Ulasan negatif juga terlihat jelas. Keluhan yang paling umum adalah kecepatan respons yang lambat - tugas serupa, Claude Fable 5, membutuhkan waktu 3,5 menit, sedangkan K3 membutuhkan waktu 12 menit. Responsivitas API berada di bawah rata-rata kategori. Kedua, harganya berada di sisi yang tinggi. Dari K2.6 ke K3, harga output meningkat hampir tiga kali lipat. Sekali lagi, ada masalah “penalaran yang berlebihan”. Beberapa pengguna melaporkan bahwa K3 akan memperluas cakupan tugas atas inisiatifnya sendiri dengan niat yang tidak jelas, sehingga meningkatkan biaya pengerjaan ulang. Ada juga masukan dari pengguna bahwa tidak ada peningkatan signifikan yang bisa dirasakan dalam skenario cahaya harian.

  • Media industri umumnya memuji hal itu. Economic Daily menafsirkan hal ini sebagai simpul baru bagi model-model besar Tiongkok untuk bergerak menuju kekuatan harga. Laporan penelitian Goldman Sachs meyakini bahwa model-model besar Tiongkok sebelumnya memasuki pasar global terutama berdasarkan kinerja biaya, dan di masa depan mereka mungkin mengandalkan kemampuan mutakhir untuk memasuki alur kerja inti pengembang global. Morgan Stanley prihatin dengan harga API Kimi K3 yang berada pada level tinggi di antara model-model top Tiongkok, dan percaya bahwa harga yang lebih tinggi memiliki signifikansi positif bagi struktur pasar model-model besar. Komunitas teknologi terpecah. Beberapa pengembang percaya ini adalah "titik balik model sumber terbuka di bidang pemrograman" karena ini adalah pertama kalinya model sumber terbuka benar-benar melampaui semua model sumber tertutup dalam kompetisi kode front-end. Yang lain percaya bahwa Benchmark adalah milik Benchmark, dan "kelambatan dan mahalnya" dalam penggunaan sebenarnya adalah biaya obyektif yang tidak dapat dihindari. Beberapa pakar industri juga menunjukkan bahwa nilai nyata K3 tidak hanya dirasakan pada sisi C, namun juga akan berfungsi sebagai model dasar untuk memberdayakan sejumlah besar usaha kecil dan menengah. Setelah bobot model menjadi sumber terbuka, sejumlah besar perusahaan dalam negeri tidak perlu melatih model besar dari awal. Dalam hal pasar modal, saham AI AS mengalami gelombang penurunan setelah peluncuran K3, yang mencerminkan kekhawatiran investor bahwa model-model mutakhir yang bersifat open-source dapat berdampak pada kemampuan penetapan harga sumber tertutup. Elon Musk meninggalkan dua komentar tentang "mengesankan" di komentar terkait, dan mencantumkan K3 sebagai target utama untuk Grok 4.6.

  • Biaya penyulingan adalah kontroversi utama. Gedung Putih secara langsung melontarkan tuduhan tersebut, namun para ahli teknis umumnya berpendapat bahwa tuduhan tersebut tidak dapat dipertahankan. Pakar teknologi AI Amerika Nathan Lambert secara terbuka menulis bahwa orang-orang yang percaya bahwa laboratorium AI Tiongkok dapat menghasilkan model yang sangat baik hanya dengan mencuri kekayaan intelektual, "sudah waktunya untuk bangun." Kepala masa depan strategis OpenAI Dean Ball juga mengakui dalam postingan kontroversialnya bahwa kinerja K3 tidak dapat dicapai dengan distilasi. Dalam hal risiko teknis, kecepatan inferensi model yang lambat saat ini merupakan kelemahan yang paling menonjol. Untuk lingkungan produksi yang memerlukan waktu respons cepat, K3 mungkin bukan pilihan terbaik. Selain itu, model ini memiliki kecenderungan untuk "beralasan berlebihan" dan cenderung memperluas cakupan tugas secara proaktif tanpa instruksi eksplisit, sehingga menimbulkan risiko dalam skenario yang memerlukan kontrol batasan yang ketat. Ada masalah nyata seputar kepatuhan dan keamanan data. Data di layanan hosting Kimi diproses di Tiongkok, yang merupakan pertimbangan penting bagi pengguna luar negeri dengan pembatasan ekspor data. Meskipun bobot sumber terbuka dapat diterapkan secara lokal setelah rilis, ambang penerapan model parameter 2,8 triliun sangat tinggi - rekomendasi resminya adalah konfigurasi super node lebih dari 64 akselerator, yang pada dasarnya tidak terjangkau bagi perusahaan dan individu biasa. Masalah ilusi model juga belum terselesaikan sepenuhnya. Huang Zhenxin sendiri mengakui bahwa "halusinasi tidak dapat diberantas sepenuhnya". Namun, K3 telah mengurangi kejadiannya secara signifikan dan memerlukan sub-Agen pemeriksa fakta dalam arsitektur Agent Swarm untuk verifikasi sekunder.

  • Orang-orang yang cocok menggunakan Kimi K3 adalah: front-end developer dan full-stack engineer, terutama tim yang terlibat dalam pengembangan UI kompleks dan front-end engineering; Insinyur dan peneliti Agen AI yang membutuhkan pemrograman otomatis jangka panjang; analis keuangan, peneliti industri, dan peneliti ilmiah, yang menangani dokumen berukuran sangat besar dan melakukan skenario penelitian mendalam jangka panjang; pelanggan perusahaan dengan persyaratan penerapan yang diprivatisasi dapat melakukan penyesuaian dan penerapan lokal setelah bobotnya bersumber terbuka. Orang yang tidak cocok untuk penggunaan langsung adalah: pengguna biasa yang hanya membutuhkan tanya jawab sederhana setiap hari dan copywriting (banyak model terjangkau sudah cukup); pengguna lingkungan produksi yang membutuhkan kecepatan respons sangat tinggi; pengembang individu yang tidak memiliki anggaran atau sumber daya GPU yang cukup, dan ambang batas penerapan mandiri terlalu tinggi. Dalam hal rekomendasi penggunaan, Anda dapat mengadopsi strategi berlapis: gunakan K3 untuk 15%-20% tugas kompleks (pemrograman siklus panjang, agen multi-langkah, analisis mendalam terhadap dokumen panjang), dan gunakan model yang lebih ringan seperti Kode K2.7 atau DeepSeek V4 Pro untuk tugas sederhana berfrekuensi tinggi harian. Mengoptimalkan panggilan API berdasarkan strategi caching juga dapat mengurangi biaya secara signifikan.

  • Kimi K3 adalah produk penting. Hal ini memungkinkan label "model sumber terbuka" untuk benar-benar bersaing dengan model sumber tertutup teratas untuk pertama kalinya. Terobosannya dalam pemrograman dan tugas-tugas jangka panjang adalah nyata, dan hal ini juga menyebabkan dampak besar di tingkat industri dan pasar. Namun secara keseluruhan, ia masih merupakan "pemain ilmiah" - ia berkinerja terbaik dalam skenario tertentu, namun masih ada kesenjangan dalam skenario umum. Pengaruh nyata jangka panjangnya mungkin tidak terletak pada jumlah panggilan API saat ini, namun pada kenyataan bahwa setelah bobot tersebut resmi menjadi open source dalam beberapa hari, bobot tersebut akan berfungsi sebagai model dasar untuk memberdayakan seluruh ekosistem AI.

Ulasan pengguna

  • avatar
    CarolynBakerJr
    K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。

  • avatar
    goldenlion904
    用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。

  • avatar
    Brjen
    API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。

  • avatar
    程彤云
    实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。

  • avatar
    KOgar
    得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。

  • avatar
    SandraHart168
    同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。

  • avatar
    游客_8
    办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。

  • avatar
    Madison_Hall_7
    精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。

  • avatar
    Karen836
    K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。

  • avatar
    月光_21
    最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。

  • avatar
    redzebra695
    前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。

  • avatar
    AbigailMitchell_2024
    把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。

  • avatar
    realSanjaSilić_dev
    用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。

  • avatar
    VEcoo
    这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。

  • avatar
    HashHunter114
    API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。

  • avatar
    Olivia.Brooks007
    刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。

  • avatar
    唐兰
    2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。

  • avatar
    Justin.Morales_99
    蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。

  • avatar
    DrErnestoMárquez_x
    编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。

  • avatar
    blPAR
    有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。

  • avatar
    Judy_Morales52014
    开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。

  • avatar
    Richard.RobertsX
    用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。

  • avatar
    胡勇丹
    做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。

  • avatar
    BCooper_2023
    普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。

  • avatar
    DanielleRamirez_668
    马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。

  • avatar
    VincentPerezZ
    刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。

  • avatar
    吴秀龙
    月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。

  • avatar
    MidhaelJensen
    第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。