Kimi K3 오픈소스판

문샷AI(월지암면)가 공개한 세계 최대 오픈소스 대형 모델. 2조 8천억 매개변수, 네이티브 멀티모달과 100만 토큰 초장문 컨텍스트 지원, 코딩 능력 세계 1위

심층 리포트

  • 2026년 7월 16일, 베이징 다크사이드 오브 더 문 테크놀로지 주식회사(Beijing Dark Side of the Moon Technology Co., Ltd.)는 총 매개변수 규모가 2조 8천억에 달하는 대형 오픈 소스 모델인 Kimi K3를 출시했습니다. 이는 현재 세계에서 가장 큰 매개변수를 가진 오픈 소스 모델입니다. Claude Fable 5 및 GPT-5.6 Sol을 능가하는 1679점으로 Frontend Code Arena 프런트엔드 프로그래밍 목록에서 1위를 차지했습니다. K3는 자체 개발한 KDA 하이브리드 선형 주의 메커니즘과 주의 잔여 기술을 기반으로 제작되었습니다. 기본적으로 시각적 이해를 지원하며 100만 개의 토큰 컨텍스트 창이 있습니다. 장거리 프로그래밍, 지식 작업, 심층 연구 및 다중 모드 이해와 같은 복잡한 작업 시나리오에 특별히 최적화되었습니다. 지구력 프로그래밍 및 에이전트 작업에서 최첨단 성능을 보여주지만 전반적인 포괄적인 지능은 여전히 ​​가장 강력한 폐쇄 소스 모델에 비해 뒤떨어져 있습니다.

  • Moonshot AI는 2023년에 설립되었으며 베이징에 본사를 두고 있습니다. 알리바바와 홍콩투자관리(홍콩투자)가 투자한 AI 스타트업 기업이다. 창립자인 양즈린(Yang Zhilin)은 이전에 칭화대학교 교차정보연구소의 조교수였습니다. 팀의 핵심 구성원은 Tsinghua University, Peking University 등 최고의 대학과 Google, Meta 등 기술 기업 출신입니다. Kimi K3는 1년 넘게 개발되었으며 Kimi K2(2025년 7월 출시)의 공식 후속 제품입니다. 그 사이 K2.5, K2.6, K2.7 코드 등 반복 버전도 출시됐다. K3의 출시는 K2의 1조 수준에서 2조 8000억 수준으로 매개변수 규모의 질적 도약을 달성했을 뿐만 아니라 기본 아키텍처에서 KDA 하이브리드 선형 주의 메커니즘(Kimi Delta Attention), 주의 잔여 기술(Attention Residuals) 및 Moon Clip 2차 최적화라는 세 가지 핵심 혁신을 이루었습니다. 키미 K3의 출시가 업계 돌풍을 일으켰다는 점도 주목할 만하다. 백악관 과학기술정책국장 마이클 크라치오스는 다크 사이드 오브 더 문이 소셜 미디어에서 앤트로픽의 우화 모델을 정제해 K3를 개발했다고 비난하고 제재와 실체 목록을 위협했다. OpenAI의 전략적 미래 책임자인 딘 볼(Dean Ball)도 OpenAI를 "감속주의 세력"이라고 부르며 공개적으로 비판했습니다. Moon Enterprise 사업의 Dark Side 책임자인 Huang Zhenxin은 K3의 성능 향상의 핵심은 근본적인 독창적인 아키텍처 혁신에서 비롯된 것이며 기존 모델의 증류된 복사본이 아니라고 분명히 대답했습니다. 다수의 권위 있는 언론과 AI 연구 학자들도 기술적인 근거가 부족하다는 점을 공개적으로 밝혔습니다.

  • Kimi K3의 핵심역량은 다음과 같은 방향에 중점을 두고 있습니다. 첫째, 가장 유망한 분야인 프로그래밍 능력이다. 프런트엔드 코드 아레나(Frontend Code Arena) 프런트엔드 코드 목록에서는 K3가 1679점으로 클로드 페이블 5(1631점), GPT-5.6 솔(1618점)을 제치고 1위에 올랐다. 실제 프로그래밍 경험은 두 가지 시나리오로 나뉩니다. 하나는 /model 명령 전환을 지원하고 장기간 연속 프로그래밍 작업에 적합한 Kimi Code 터미널 도구를 통해 사용됩니다. 다른 하나는 OpenAI SDK와 호환되는 Kimi API를 통해 호출되며 가격은 캐시 적중 시 토큰 백만 개당 0.3달러, 입력 누락 시 3달러, 출력 시 15달러입니다. 두 번째는 장거리 업무 처리 능력이다. 공식적으로 입증된 사례로는 연속 48시간 동안 독립적으로 칩 설계 및 최적화를 완료하고 약 2시간 만에 전산천체물리학 분야에서 I-Love-Q 보편적 관계를 재현한 것이 포함됩니다. K3는 장기간의 엔지니어링 작업을 지속적으로 완료하고 대규모 코드 기반을 이해 및 처리하며 최소한의 인간 감독으로 터미널 도구 사용을 조정할 수 있습니다. 세 번째는 다중모달 이해 능력이다. K3는 기본적으로 이미지와 텍스트의 다중 모드 입력을 지원합니다. 플러그인 시각적 인코더가 아니라 진정한 기본 시각적 이해입니다. 이는 텍스트, 이미지 및 비디오 입력을 동시에 처리할 수 있음을 의미합니다. API를 사용하는 방법에는 네 가지가 있습니다. Kimi 모바일 앱(iOS/Android/HarmonyOS)을 통해 직접 무료로 채팅하세요. Kimi Work 3.1.0 이상의 데스크톱 버전은 작업 현장 지원을 제공합니다. Kimi Code 터미널 도구는 프로그래머를 대상으로 합니다. Kimi API 플랫폼은 개발자와 기업 사용자를 대상으로 합니다. 관계자는 데이터 개인 정보 보호 및 회원 관리 기능을 제공하는 Kimi Enterprise 엔터프라이즈 버전도 제공합니다. 실제 사용자 경험의 관점에서 프론트엔드 개발자와 프로그래머들은 일반적으로 높은 평가를 내리며 K3가 프론트엔드 코드 생성 및 UI 복원에서 "설계 의도를 정확하게 이해한다"고 믿고 있습니다. 그러나 일반 사용자들의 피드백은 양극화되어 있습니다. 어떤 사람들은 복잡하고 긴 텍스트를 분석하는 데 확실히 더 좋다고 느끼는 반면, 다른 사람들은 "일상 대화에 큰 차이가 없다"고 불평합니다.

  • Kimi K3의 API 가격은 중국 헤드 모델 중 최고 수준입니다. 생산량은 백만 토큰당 미화 15달러(약 100위안)입니다. 이전 세대 K2.6은 4달러로 거의 3배 증가했습니다. 국내 유사모델인 GLM-5.2의 출력가격은 4.4달러이다. 그러나 공식에서 제공한 중요한 데이터는 다음과 같습니다. 프로그래밍 시나리오에서 캐시 적중률은 90%를 초과할 수 있으므로 실제 지출은 표시된 가격보다 훨씬 낮습니다. 캐시 적중 입력 비용은 백만 토큰당 0.3달러에 불과합니다. 관계자에 따르면 Mooncake의 분리 추론 아키텍처에 의존하는 이 시스템은 K3를 고주파 프로그래밍 시나리오에서 매우 비용 효율적으로 만듭니다. Moon Enterprise Business의 Dark Side 책임자인 Huang Zhenxin은 오픈 소스 모델과 대형 중국 모델을 저가형으로 분류해서는 안 된다는 점을 분명히 했습니다. "저희는 합리적인 상용 가격도 맞출 수 있는 SOTA 수준의 모델을 구축했습니다." 인공 분석의 계산에 따르면 Kimi K3의 단일 작업 비용은 약 0.94달러로 GPT-5.6 Sol의 1.04달러에 가깝습니다. 표면에 보이는 것보다 훨씬 저렴하지 않습니다. 소비자 측면에서 Kimi의 무료 버전에는 특정 K3 할당량이 포함되어 있으며 유료 멤버십은 최대 699위안/월까지 여러 계층으로 나뉩니다. 일부 사용자는 할당량의 20%가 하루에 사용되었다고 보고했는데, 이는 헤비 사용자에 대한 비용을 무시할 수 없음을 의미합니다. Dark Side of the Moon은 오픈 소스 경로를 고수할 것이라고 말합니다. 수정된 MIT 라이선스에 따라 2026년 7월 27일 이전에 출시된 전체 모델 가중치입니다. 프라이빗 배포 및 세부 조정이 필요한 기업 고객에게 오픈 소스는 높은 가치를 지닌 옵션입니다.

  • 긍정적인 의견은 주로 세 가지 측면에 중점을 둡니다. 첫째, 프로그래밍 시나리오 경험이 뛰어나고 프런트 엔드 코드 생성 품질이 높으며 설계 의도가 정확하게 이해됩니다. Vercel 창립자 Guillermo Rauch도 실제 테스트와 검증을 수행했습니다. 둘째, 긴 텍스트와 긴 작업을 처리하는 능력이 뛰어납니다. 사용자들은 수십 페이지의 문서를 요약하면 K3가 핵심 정보를 정확하게 추출하고 사전에 빼며 "더 나은 판단을 내리기 시작"할 수 있다고 보고했습니다. 셋째, 전문적인 시나리오(재무 분석, 계약 검토, 산업 조사)의 자동화 기능이 만족스럽습니다. 일부 사용자는 계약에서 숨겨진 자동 갱신 조항을 찾는 데 이를 사용했습니다. 부정적인 리뷰도 분명합니다. 가장 일반적인 불만은 느린 응답 속도입니다. 유사한 작업인 Claude Fable 5는 3.5분이 걸렸고 K3는 12분이 걸렸습니다. API 응답성은 카테고리 평균보다 낮습니다. 둘째, 가격이 높은 편입니다. K2.6부터 K3까지 출력 가격이 3배 가까이 올랐다. 여기서도 역시 '과도한 추론'의 문제가 있습니다. 일부 사용자는 K3가 막연한 의도로 자체적으로 작업 범위를 확장하여 재작업 비용을 증가시킬 것이라고 보고합니다. 일상적인 조명 시나리오에서는 큰 개선이 느껴지지 않는다는 사용자 피드백도 있습니다.

  • 업계 언론은 일반적으로 이에 대해 높이 평가했습니다. 경제일보는 이를 중국 대형 모델이 가격 결정력을 향해 나아가는 새로운 교점으로 해석했다. Goldman Sachs 연구 보고서에 따르면 중국의 대형 모델은 이전에는 주로 비용 성능을 기반으로 글로벌 시장에 진출했으며 앞으로는 최첨단 역량에 의존하여 글로벌 개발자의 핵심 워크플로에 진입할 수 있습니다. 모건스탠리는 키미 K3의 API 가격이 중국 상위 모델 중 높은 수준이라는 점을 우려하고 있으며, 가격 인상이 대형 모델 시장 구조에 긍정적인 영향을 미칠 것으로 보고 있다. 기술 커뮤니티는 나뉘어져 있습니다. 일부 개발자들은 오픈 소스 모델이 프런트 엔드 코드 경쟁에서 모든 폐쇄 소스 모델을 완전히 능가한 것은 처음이기 때문에 이것이 "프로그래밍 분야에서 오픈 소스 모델의 전환점"이라고 생각합니다. 다른 사람들은 벤치마크가 벤치마크에 속하며, 실제 사용 시의 "느림과 비용"은 피할 수 없는 객관적인 비용이라고 생각합니다. 일부 업계 전문가들은 K3의 진정한 가치를 C사이드에서만 경험할 수 있는 것이 아니라, 다수의 중소기업에 힘을 실어주는 베이스 모델이 될 것이라고 지적하기도 했다. 모델 가중치가 오픈 소스화되면 많은 국내 기업이 처음부터 대형 모델을 학습할 필요가 없습니다. 자본 시장 측면에서 미국 AI 주식은 K3 출시 이후 하락세를 보였는데, 이는 오픈 소스 최첨단 모델이 폐쇄 소스 가격 책정 능력에 영향을 미칠 수 있다는 투자자의 우려를 반영합니다. 엘론 머스크는 관련 댓글에 '인상적이다'라는 두 가지 댓글을 남겼고, K3를 그록 4.6의 핵심 타깃으로 꼽았다.

  • 증류 비용이 주요 논란이었습니다. 백악관이 직접 비난했지만 기술 전문가들은 일반적으로 이런 비난은 받아들일 수 없다고 본다. 미국의 AI 기술 전문가 네이슨 램버트(Nathan Lambert)는 중국의 AI 연구소가 지적 재산을 훔치는 것만으로 우수한 모델을 생산할 수 있다고 믿는 사람들이 "이제 깨어날 때다"라고 공개적으로 썼다. OpenAI의 전략적 미래 책임자인 Dean Ball도 논란의 게시물에서 K3 성능은 증류로는 달성할 수 없다는 점을 인정했습니다. 기술적 위험 측면에서 현재 모델의 느린 추론 속도가 가장 두드러진 단점입니다. 빠른 응답 시간이 필요한 프로덕션 환경의 경우 K3가 최선의 선택이 아닐 수도 있습니다. 또한 모델은 "과도한 추론" 경향이 있으며 명시적인 지시 없이 작업 범위를 사전에 확장하는 경향이 있어 엄격한 경계 제어가 필요한 시나리오에서 위험을 초래합니다. 규정 준수 및 데이터 보안과 관련하여 실제 문제가 있습니다. Kimi 호스팅 서비스의 데이터는 중국 내에서 처리되는데, 이는 데이터 수출 제한이 있는 해외 사용자에게 중요한 고려 사항입니다. 오픈 소스 가중치는 출시 후 로컬로 배포할 수 있지만 2조 8천억 매개변수 모델의 배포 임계값은 매우 높습니다. 공식적인 권장 사항은 64개 이상의 액셀러레이터로 구성된 슈퍼 노드 구성으로 기본적으로 일반 기업과 개인에게는 감당할 수 없는 수준입니다. 모형 환상 문제도 완전히 해결되지 않았습니다. Huang Zhenxin 자신도 "환각은 완전히 근절될 수 없다"고 인정했습니다. 그러나 K3는 발생률을 크게 줄였으며 2차 검증을 위해 Agent Swarm 아키텍처의 사실 확인 하위 에이전트가 필요합니다.

  • Kimi K3를 사용하기에 적합한 사람들은 다음과 같습니다: 프론트 엔드 개발자 및 풀 스택 엔지니어, 특히 복잡한 UI 개발 및 프론트 엔드 엔지니어링에 종사하는 팀; 장기간의 자동화 프로그래밍이 필요한 AI Agent 엔지니어 및 연구자 매우 큰 문서를 다루고 장기적으로 심층적인 연구 시나리오를 수행하는 금융 분석가, 업계 연구원 및 과학 연구원 민영화된 배포 요구 사항이 있는 기업 고객은 가중치가 오픈 소스로 공개된 후 로컬 미세 조정 및 배포를 수행할 수 있습니다. 즉시 사용하기에 적합하지 않은 사람들은 다음과 같습니다: 일상적인 간단한 Q&A 및 카피라이팅만 필요한 일반 사용자(많은 저렴한 모델이면 충분함) 극도로 빠른 응답 속도를 요구하는 생산 환경 사용자; 예산이나 GPU 리소스가 충분하지 않고 자체 배포의 문턱이 너무 높은 개인 개발자. 사용 권장 사항 측면에서 계층화된 전략을 채택할 수 있습니다. 복잡한 작업(장주기 프로그래밍, 다단계 에이전트, 긴 문서의 심층 분석)의 15%-20%에는 K3를 사용하고 일상적인 고주파수 단순 작업에는 K2.7 Code 또는 DeepSeek V4 Pro와 같은 더 가벼운 모델을 사용합니다. 캐싱 전략을 기반으로 API 호출을 최적화하면 비용도 크게 절감할 수 있습니다.

  • 키미K3는 랜드마크 제품이다. 이를 통해 "오픈 소스 모델"이라는 레이블이 처음으로 최고의 폐쇄 소스 모델과 진정으로 경쟁할 수 있게 되었습니다. 프로그래밍과 장거리 작업의 획기적인 발전은 현실이며, 업계와 시장 수준에서도 큰 반향을 일으켰습니다. 그러나 전반적으로 여전히 "과학적 플레이어"입니다. 특정 시나리오에서는 최고 수준의 성능을 발휘하지만 일반적인 시나리오에서는 여전히 격차가 있습니다. 실제 장기적인 영향은 오늘날 API 호출 수에 있지 않을 수도 있지만, 가중치가 며칠 안에 공식적으로 오픈 소스화되면 전체 AI 생태계에 힘을 실어주는 기본 모델 역할을 할 것입니다.

사용자 리뷰

  • 아바타
    CarolynBakerJr
    K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。

  • 아바타
    goldenlion904
    用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。

  • 아바타
    Brjen
    API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。

  • 아바타
    程彤云
    实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。

  • 아바타
    KOgar
    得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。

  • 아바타
    SandraHart168
    同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。

  • 아바타
    游客_8
    办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。

  • 아바타
    Madison_Hall_7
    精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。

  • 아바타
    Karen836
    K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。

  • 아바타
    月光_21
    最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。

  • 아바타
    redzebra695
    前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。

  • 아바타
    AbigailMitchell_2024
    把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。

  • 아바타
    realSanjaSilić_dev
    用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。

  • 아바타
    VEcoo
    这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。

  • 아바타
    HashHunter114
    API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。

  • 아바타
    Olivia.Brooks007
    刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。

  • 아바타
    唐兰
    2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。

  • 아바타
    Justin.Morales_99
    蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。

  • 아바타
    DrErnestoMárquez_x
    编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。

  • 아바타
    blPAR
    有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。

  • 아바타
    Judy_Morales52014
    开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。

  • 아바타
    Richard.RobertsX
    用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。

  • 아바타
    胡勇丹
    做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。

  • 아바타
    BCooper_2023
    普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。

  • 아바타
    DanielleRamirez_668
    马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。

  • 아바타
    VincentPerezZ
    刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。

  • 아바타
    吴秀龙
    月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。

  • 아바타
    MidhaelJensen
    第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。