Kimi K3 開源版

月之暗面釋出的全球最大開源大模型,2.8萬億引數,原生支援多模態和100萬token超長上下文,程式設計能力登頂全球

深度報告

  • 2026 年 7 月 16 日,北京月之暗面科技有限公司釋出了 Kimi K3,一款總引數規模達 2.8 萬億的開源大模型。這是目前全球引數最大的開源模型,在 Frontend Code Arena 前端程式設計榜單中以 1679 分登頂,超越 Claude Fable 5 和 GPT-5.6 Sol。K3 基於自研 KDA 混合線性注意力機制和注意力殘差技術構建,原生支援視覺理解,擁有 100 萬 token 上下文視窗,面向長程程式設計、知識工作、深度研究和多模態理解等複雜任務場景進行了專項最佳化。它在續航類程式設計和智慧體任務上展現出前沿水平,但整體綜合智慧仍落後於最強的閉源模型。

  • 月之暗面(Moonshot AI)成立於 2023 年,總部位於北京,是阿里巴巴和香港投資管理有限公司(港投)被投的 AI 創業公司。創始人楊植麟此前是清華大學交叉資訊研究院的助理教授,團隊核心成員來自清華、北大等頂級高校和 Google、Meta 等科技公司。 Kimi K3 的研發歷時一年多,是 Kimi K2(2025 年 7 月釋出)的正式繼任者。中間還發布了 K2.5、K2.6、K2.7 Code 等迭代版本。此次 K3 的釋出不僅在引數規模上實現了質的飛躍——從 K2 的萬億級躍升至 2.8 萬億——更在底層架構上進行了三項關鍵創新:KDA 混合線性注意力機制(Kimi Delta Attention)、注意力殘差技術(Attention Residuals)和 Moon Clip 二階最佳化器。 值得注意的是,Kimi K3 的釋出也引發了一場行業風波。美國白宮科技政策辦公室主任邁克爾·克拉齊奧斯在社交媒體上指控月之暗面透過蒸餾 Anthropic 的 Fable 模型來開發 K3,並威脅使用制裁和實體清單。OpenAI 戰略未來負責人迪恩·鮑爾也公開發帖抨擊,稱其為「減速主義力量」。月之暗面企業業務負責人黃震昕明確回應稱,K3 效能躍升的核心來自底層原創架構創新,並非對現有模型的蒸餾復刻。多家權威媒體和 AI 研究學者也公開站臺,指出指控缺乏技術依據。

  • Kimi K3 的核心能力集中在以下幾個方向。首先是程式設計能力,這是它最被看好的領域。在 Frontend Code Arena 前端程式碼榜單上,K3 以 1679 分排名第一,超過 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。實際的程式設計體驗分為兩種場景:一種是透過 Kimi Code 終端工具使用,支援 /model 命令切換,適合長期持續程式設計任務;另一種是透過 Kimi API 呼叫,相容 OpenAI SDK,定價為快取命中每百萬 token 0.3 美元、未命中輸入 3 美元、輸出 15 美元。 其次是長程任務處理能力。官方展示的案例包括連續 48 小時自主完成晶片設計和最佳化、約兩小時復現計算天體物理領域的 I-Love-Q 普適關係。在極少人工監督的情況下,K3 可以持續完成長時間工程任務,理解和處理大型程式碼庫,並協調使用終端工具。 第三是多模態理解能力。K3 原生支援圖文多模態輸入,不是外掛視覺編碼器,而是真正的原生視覺理解。這意味著它可以同時處理文字、影象和影片輸入。 API 有四種使用方式。透過 Kimi 移動端應用(iOS/Android/HarmonyOS)可以直接免費對話。桌面版 Kimi Work 3.1.0 以上版本提供工作場景支援。Kimi Code 終端工具面向程式設計師。Kimi API 平臺則面向開發者和企業使用者。官方還提供了 Kimi Enterprise 企業版,提供資料隱私保護和成員管理功能。 從實際使用者體驗來看,前端開發者和程式設計師普遍給出較高評價,認為 K3 在前端程式碼生成和 UI 還原上「理解設計意圖準確」。但普通使用者的反饋則兩極分化——有人覺得它在複雜長文分析上確實更好,但也有人吐槽「日常對話感受不到巨大差別」。

  • Kimi K3 的 API 定價處於中國頭部模型的高位——輸出每百萬 token 15 美元,約合人民幣 100 元。上一代 K2.6 是 4 美元,漲了近 3 倍。國內同類模型智譜 GLM-5.2 的輸出價是 4.4 美元。 不過官方給出的一個重要資料是:在程式設計場景下,快取命中率可以超過 90%,因此實際支出遠低於標價。快取命中輸入僅需 0.3 美元每百萬 token。官方稱,依賴 Mooncake 分離式推理架構的這套體系,使得 K3 在高頻程式設計場景下具備很高的價效比。 月之暗面企業業務負責人黃震昕明確表示,開源模型和中國大模型不該被貼上低價標籤。「我們做出了 SOTA 級模型,也能匹配合理的商業定價。」Artificial Analysis 的測算顯示,Kimi K3 的單任務成本約為 0.94 美元,與 GPT-5.6 Sol 的 1.04 美元接近,並不像表面上看起來便宜很多。 消費者端,Kimi 免費版包含一定的 K3 額度,付費會員分為多個檔位,最高 699 元/月。有使用者反映一天內用掉了 20% 的額度,意味著重度使用者的成本不容忽視。 月之暗面稱將堅持開源路線。完整模型權重於 2026 年 7 月 27 日前釋出,採用修改版 MIT 許可證。對於有私有化部署和微調需求的企業客戶來說,開源是高價值的選擇。

  • 正面評價主要集中在三個方面。一是程式設計場景下體驗極好,前端程式碼生成質量高,理解設計意圖準確,Vercel 創始人 Guillermo Rauch 也做了實測驗證。二是長文字和長任務處理能力突出,使用者反饋將幾十頁文件丟進去做總結時,K3 能精準提煉關鍵資訊,主動做減法,「開始有判斷力了」。三是專業化場景(金融分析、合同審查、行業研究)中的自動化能力讓人滿意,有使用者用它找出了合同中的隱藏自動續約條款。 負面評價也很明顯。吐槽最集中的是響應速度慢——同類任務 Claude Fable 5 耗時 3.5 分鐘,K3 需要 12 分鐘。API 響應速度低於同類平均水平。其次是定價偏高,從 K2.6 到 K3,輸出價格翻了近 3 倍。再次是「過度推理」的問題,部分使用者反映 K3 在模糊意圖下會自作主張擴充套件任務範圍,增加返工成本。也有使用者反饋,日常輕度場景下感受不到顯著提升。

  • 行業媒體整體給予了高度評價。經濟日報將其解讀為中國大模型走向定價權的新節點。高盛研報認為,此前中國大模型主要靠價效比進入全球市場,未來可能憑藉前沿能力進入全球開發者的核心工作流。摩根士丹利則關注到 Kimi K3 的 API 價格處於中國頭部模型高位,認為較高定價對大模型市場格局具有積極意義。 技術社群的分歧較大。一部分開發者認為它是「開源模型在程式設計領域的轉折點」,因為這是第一次有開源模型在前端程式碼競賽中全面超越所有閉源模型。另一部分人則認為 Benchmark 歸 Benchmark,實際使用中的「慢和貴」是繞不開的客觀代價。也有業內專家指出,K3 的真實價值不只在 C 端體驗,而在於它將作為基座模型賦能大量中小企業——模型權重開源後,國內大量公司不用從零訓練大模型。 在資本市場方面,K3 釋出後美國 AI 股票出現了一波下跌,反映了投資者對開源前沿模型可能衝擊閉源定價能力的擔憂。埃隆·馬斯克在相關評測下兩次留言「令人印象深刻」,並將 K3 列為 Grok 4.6 的重點對標目標。

  • 蒸餾指控是最主要的爭議。美國白宮直接出面指控,但技術專家普遍認為這一指控站不住腳。美國 AI 技術專家內森·蘭伯特公開撰文指出,認為中國 AI 實驗室僅透過竊取智慧財產權就能做出優秀模型的人「是時候醒醒了」。OpenAI 戰略未來負責人迪恩·鮑爾也在爭議性帖子中承認 K3 效能無法依靠蒸餾實現。 技術風險方面,模型的推理速度偏慢是當前最突出的短板。對於需要快速響應的生產環境,K3 可能不是最優選擇。此外模型存在「過度推理」傾向,容易在無明確指令的情況下主動擴充套件任務範圍,這在需要嚴格邊界控制的場景中構成風險。 合規和資料安全方面存在現實問題。Kimi 的託管服務中的資料在中國境內處理,對於有資料出境限制的海外使用者來說是一個重要考量。儘管開源權重發布後可以在本地部署,但 2.8 萬億引數模型的部署門檻極高——官方推薦 64 個以上加速器的超節點配置,普通企業和個人基本無法負擔。 模型幻覺問題也沒有完全解決。黃震昕本人坦言「幻覺無法徹底根除」,但 K3 已大幅壓低其發生率,並要求配套 Agent Swarm 架構中的事實校驗員子 Agent 進行二次驗證。

  • 適合使用 Kimi K3 的人群是:前端開發者和全棧工程師,尤其是從事複雜 UI 開發和前端工程化的團隊;需要長時間自動化程式設計的 AI Agent 工程師和研究人員;金融分析師、行業研究員和科研人員,處理超大文件和進行長週期深度研究的場景;有私有化部署需求的企業客戶,可以在權重開源後進行本地微調和部署。 不太適合立即使用的人群是:僅需要日常簡單問答和文案寫作的普通使用者(很多平價模型足夠);對響應速度要求極高的生產環境使用者;沒有足夠預算或 GPU 資源的個人開發者,自部署門檻太高。 使用建議上,可以採取分層策略:將 K3 用於那 15%—20% 的複雜任務(長週期程式設計、多步驟 Agent、長文件深度分析),日常高頻簡單任務則搭配 K2.7 Code 或 DeepSeek V4 Pro 這類更輕量的模型。根據快取策略最佳化 API 呼叫也能大幅降低成本。

  • Kimi K3 是一個里程碑式的產品,它讓「開源模型」這個標籤第一次真正站到了與頂尖閉源模型同臺競技的層面。它在程式設計和長程任務上的突破是真實的,也在行業和市場層面引發了巨大回響。但它整體上仍是一個「偏科型選手」——在特定場景下表現頂級,在通用場景中尚有差距。它的真正長期影響力或許不在今天的 API 呼叫量,而在於幾天後權重正式開源後,它將作為基座模型賦能整個 AI 生態。

使用者評論

  • 頭像
    CarolynBakerJr
    K3 的前端程式碼能力是真的強,丟了個複雜的企業後臺需求進去,生成出來的頁面審美線上,互動邏輯也基本對的。不過速度是真的慢,等得有點著急。

  • 頭像
    goldenlion904
    用 K3 做了個 3D 遊戲 demo,效果超出預期。它自己從零寫程式碼、修 bug、調樣式,全程不用我怎麼管就是每次等它改完都要喝杯咖啡。

  • 頭像
    Brjen
    API 價格從 K2.6 的 4 刀漲到 15 刀,漲幅快 3 倍。雖然快取命中能省不少,但心裡還是有點難受。

  • 頭像
    程彤雲
    實測了三天,K3 最大的變化是開始有判斷力了。以前問個問題給你列七八條,現在直接砍掉那些正確的廢話,留下的全是真正決策有關的資訊。這點比引數提升更難得。

  • 頭像
    KOgar
    得承認這是國產開源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一個檯面上。以前說對標只是口號,這次評測資料是真的接近了。

  • 頭像
    SandraHart168
    同一個 bug 修復任務,Claude Fable 5 用了 3.5 分鐘,K3 用了 12 分鐘。差距很明顯,不光是速度,對話響應也偏慢。

  • 頭像
    遊客_8
    辦公場景測了寫週報和做 PPT。寫週報真的香,把零散的工作記錄丟進去,自動給你包裝成專業版本。做 PPT 就比較弱了,只給文字大綱,頁數還失控,不如豆包的一鍵生成好用。

  • 頭像
    Madison_Hall_7
    精度確實有提升,中文綜合從 72.9% 到 75.6%,coding 從 62.6% 到 70.3%。但 token 消耗也上去了,同樣任務花的錢多了不少。只能說 SOTA 級模型配 SOTA 級價格吧。

  • 頭像
    Karen836
    K3 有點太愛表現了,讓它總結一段產品說明,它不光總結,還自作主張加了一段風險分析。問題是原文根本沒提風險,純屬腦補。複雜任務用它,簡單任務還是切回 K2 更省心。

  • 頭像
    月光_21
    最搞笑的是官方自己都承認綜合方面還落後 Fable 5 和 Sol,但社群吹得好像已經全面碾壓了。理性看待吧,K3 在特定場景下確實強,通用能力還是有差距。

  • 頭像
    redzebra695
    前端程式碼是真的強,Frontend Code Arena 1679 分登頂不是吹的。跟 Fable 5 和 Sol 同時生成同一個 SaaS 落地頁,K3 的審美確實線上,按鈕間距和配色比例看著更舒服。

  • 頭像
    AbigailMitchell_2024
    把幾十頁的行業白皮書扔進去,讓 K3 提煉三個關鍵變化,它給得很準,而且主動標出了需要留意風險的地方。長文件處理確實比 K2 強一個檔次。

  • 頭像
    realSanjaSilić_dev
    用 K3 檢查租房合同,幫找出一條自動續約的隱藏條款。這功能說大不大,但省了我一筆可能的損失。

  • 頭像
    VEcoo
    這個模型在科研程式設計的場景太適合了。我用來複現一篇計算化學的論文結果,K3 自己讀了程式碼庫、修了依賴衝突、跑了引數掃描,整個過程跑了大概 5 個小時,但我基本沒幹預。

  • 頭像
    HashHunter114
    API 接入挺簡單的,相容 OpenAI SDK,改個 base_url 就行。速度偏慢但穩定性還不錯,跑了幾個長任務沒有出現中斷。

  • 頭像
    Olivia.Brooks007
    剛釋出就斷售了,負載扛不住可見熱度多誇張。好在 API 還能用,網頁端等了兩天才上去。希望擴容快點跟上。

  • 頭像
    唐蘭
    2.8萬億引數聽起來很嚇人,但實際啟用的只有 16/896 個專家,推理算力要求其實沒想象中那麼離譜。問題是自部署需要 64 個以上加速器,個人開發者基本沒戲。

  • 頭像
    Justin.Morales_99
    蒸餾指控真的有點離譜。K3 公佈的架構創新——KDA 注意力機制和 Attention Residuals——都是有技術論文支撐的。說靠蒸餾做出 2.8T 引數的模型,技術上就不可能。

  • 頭像
    DrErnestoMárquez_x
    程式設計能力確實強,但推理速度偏慢。同樣是生成一個 Three.js 的瀑布場景,GPT-5.6 Sol 幾分鐘搞定,K3 花了半小時。不過最後成片的質量 K3 反而更好,彩虹和水霧的細節處理更自然。慢工出細活吧。

  • 頭像
    blPAR
    有些人的期望太高了,覺得釋出後就應該吊打所有閉源。實際用下來,K3 是頂級程式設計選手但日常對話有過度推理的問題,選對場景很重要。

  • 頭像
    Judy_Morales52014
    開通了 699 元/月的最高檔會員,重度用了一天額度掉了 20%。雖然心疼但確實值,複雜文件處理效率至少翻倍。

  • 頭像
    Richard.RobertsX
    用 K3 做了個流量回放平臺,從需求到跑起來大概半天。之前用別的模型至少折騰兩天。它對長程式碼庫的理解力確實比前代強很多。

  • 頭像
    胡勇丹
    做 2D 遊戲很強,讓 K3 復刻泡泡堂,它自己拆成兩條並行工作線,地圖、角色、邏輯一起寫,最終跑起來能玩。就一句話需求,它理解得太好了。

  • 頭像
    BCooper_2023
    普通使用者可能感受不到 K3 的強大,因為日常寫文案聊天跟 K2 差別不大。但如果你做程式設計或者研究,差距是非常明顯的。

  • 頭像
    DanielleRamirez_668
    馬斯克又點讚了,還說要拿 Grok 4.6 跟 K3 對標。能被這個級別的玩家當成對標目標,本身就是實力認證了。

  • 頭像
    VincentPerezZ
    剛上手就給它丟了一個大專案,自己寫了個迷你 GPU 編譯器,從零開始,最後跑通了 nanoGPT 訓練。雖然不是生產級的,但 48 小時能做成這樣確實讓人驚訝。

  • 頭像
    吳秀龍
    月之暗面的開放策略值得肯定,K3 權重將在 7 月 27 日前開源。國內中小企業可以基於這個基座做二次開發,不用從零訓練大模型了。

  • 頭像
    MidhaelJensen
    第一時間就試了,拿前端程式碼競技場的題讓它跑,確實一把過。這是第一次有開源模型在這個榜單上超過 Claude 和 GPT。