深度報告
-
Kimi K3 是月之暗面(Moonshot AI)規劃中的下一代旗艦大模型,官方確認將於 2026 年第三季度釋出,引數規模達到 2.5 萬億(MoE 混合專家架構),並把上下文視窗擴充套件到約 100 萬 token(約 100 萬字)。 它延續了 Kimi 系列在超長文字上的傳統優勢,同時補齊了原生多模態與更強程式碼、智慧體能力,意在把國產大模型的引數與綜合體驗天花板再往上抬一截。截至本報告撰寫時,K3 仍處於釋出前階段,公開基準多為社群洩露或內部測試,正式能力以釋出後為準。
-
月之暗面由楊植麟創立,是國內最早以「超長上下文」打出差異化的 AI 實驗室。Kimi 智慧助手 2023 年上線後迅速成為國內最受歡迎的 AI 產品之一,2026 年初 K2.5 模型登頂多個開源榜單,年經常性收入(ARR)突破 1 億美元,跑通了規模化商業閉環。 K3 釋出的背景是公司剛完成新一輪融資,投前估值達到 315 億美元,資本儲備為模型研發、算力擴容和商業化落地提供了支撐。從技術路線看,K2 系列(K2、K2.5、K2.6、K2.7 Code)聚焦長文字與程式碼能力,K3 則是一次代際跨越,不只是引數翻倍,更是架構正規化的升級。
-
Kimi 系列的核心體驗圍繞「把一整本書、一整套程式碼庫或幾十篇論文一次性喂進去」展開。官方標稱支援 200 萬漢字上下文,K3 將這一能力推向萬億引數級別,宣稱約 100 萬 token 視窗,意味著上百份合同、整套專案程式碼或一整本書都能單次上傳、無需分段。 配合聯網搜尋、檔案解析(PDF/Word/Excel/PPT)、多文件對比與記憶工具,Kimi 適合長文摘要、合同解讀、學術分析和程式碼工程等場景。K3 進一步引入原生多模態,文字、影象、音影片統一理解,使用者可以直接上傳圖片、音訊或影片片段讓模型做跨模態推理。 需要注意的是,當前版本「200 萬字」更接近訓練時見過的最大長度,真實穩定可用的處理視窗在實測中約 12 萬至 18 萬字,超出後首尾資訊會明顯衰減,長文字任務仍需主動切片。
-
K3 採用升級擴充套件 MoE(Expanded MoE)架構,相比 K2 系列的有限專家加靜態路由,引入更多細粒度專家與動態自適應路由,讓每個 token 更精準匹配專家子網路,在引數暴增的同時控制推理成本。 在 Kimi Linear 線性注意力架構基礎上,團隊探索了 Kimi Delta Attention 與 KDA 等新思路,目標是用線性注意力改進迴圈記憶管理、提升硬體效率並降低訓練與推理成本。能力亮點集中在三方面:一是 1M 級超長上下文,金融財報、法律卷宗、全鏈路軟體開發的長程任務直接受益;二是原生一體化多模態,文字、影象、音影片統一理解,在競品多模態仍有短板的視窗期形成差異化;三是更強的程式碼與智慧體能力,K2.6 已在 SWE-Bench 領跑開源模型,K3 有望進一步拉開差距。 社群洩露的基準(未經官方驗證)顯示 MMLU 92.4、HumanEval 94.1、MATH 88.7、GPQA 72.3、SWE-bench 55.2,推理與程式碼維度進步明顯。
-
K3 的正式定價尚未公佈,預計定位高階、高於現有 K2 系列。作為參照,Kimi 開放平臺當前 K2.6 的定價為快取命中每百萬 token 1.10 元、輸入 6.50 元、輸出 27.00 元;K2.5 為快取命中 0.70 元、輸入 4.00 元、輸出 21.00 元。 月之暗面的變現路徑包括開放平臺 API 呼叫、Kimi 智慧助手 C 端訂閱,以及面向企業的行業解決方案。公司 ARR 已破 1 億美元,商業飛輪基本跑通,K3 的釋出意在用旗艦能力拉動高階 API 與企業客戶,同時鞏固 C 埠碑。
-
正面反饋集中在中文理解與表達自然、超長上下文業界領先、國內可直接訪問無需翻牆、免費額度慷慨、檔案解析(尤其 PDF)能力強。開發者和研究者喜歡它一次性處理大體積資料的能力,法務、諮詢、學術場景用得多。 負面反饋也很明確:英文能力弱於 ChatGPT 與 Claude,影象生成暫時較弱,程式碼能力不及 Cursor 等專業工具,推理速度有時偏慢;多模態仍處於初級階段,表格與跨頁斷行、公式邏輯容易被誤讀;移動端 App 相比 Web 端功能閹割明顯(檔案上限 10MB、隱藏高階角色與生成按鈕)。 部分使用者實測發現長文字超過約 12 萬字後首尾衰減顯著,關鍵資料會出現「語義補全」式錯誤,需要人工二次校驗。
-
業內普遍認為 K3 的 2.5 萬億引數將重新整理國產基座模型引數上限,超過 DeepSeek V4 Pro 的 1.6 萬億與百度文心 5.0 的 2.4 萬億,與阿里 Qwen 3.6、智譜 GLM 系列同臺競爭。媒體分析指出,國產大模型競爭已進入超大引數、全能模態比拼階段,K3 的上線將縮小與海外頂級模型的技術差距。 也有冷靜聲音提醒,引數規模不等於最終能力,訓練資料質量、算力排程效率、推理速度與上下文視窗長度都會決定體驗;K3 能否在 2.5 萬億體量下真正跑通動態路由與線性注意力,還要看釋出後的真實表現。
-
主要風險有幾類。一是「引數至上」敘事的泡沫:引數量翻倍帶來更高算力與運營成本,普通使用者能否用得上、用得起仍存疑,內部測試的 1M 上下文最終是否向使用者開放也懸而未決。 二是能力宣傳與現實體驗的落差:長上下文穩定視窗遠小於標稱值,多模態與表格、公式處理仍有明顯短板,過度依賴可能引入錯誤。三是資料合規與過度依賴風險:上傳合同、論文等敏感資料時的資料安全,以及把 AI 輸出直接用於決策的法律與業務風險,都需要使用者自行把關。四是釋出節奏與預期管理:K3 從「官宣 Q3」到正式可用之間存在視窗,社群基準多未經驗證,需警惕提前狂歡。
-
Kimi K3 適合處理超長文件閱讀與摘要、中文內容創作、學術論文分析、合同與法律檔案解讀、多檔案對比整理,以及需要長上下文支撐的程式碼與研究報告任務的中文使用者。它不適合把多模態表格、複雜公式推演或英文重度任務作為核心依賴的使用者,這類場景建議配合 Cursor、Claude 或專業工具交叉驗證。 使用建議:長文字主動切片到 12 萬字以內以保證召回準確;PDF 優先於 Word;涉及法條、財務公式的任務務必人工複核;把 Kimi 當作「第一遍草稿與資訊抽取」而非「終審結論」。
-
Kimi K3 是月之暗面從「追趕」走向「並跑」的關鍵一代,2.5 萬億引數與原生多模態讓國產旗艦首次在體量上摸到全球第一梯隊門檻;它值得期待,但正式能力、真實上下文上限與定價,都要等第三季度釋出後用實測說話。
使用者評論
-
Sandra_HarrisZ—卡成PPT,真退了。 -
WilliamButler369—太強了!前端編碼直接登頂,國產模型第一次這麼硬氣。 -
BrandonNguyen007—試用了幾天K3,前端能力確實頂,一個提示詞生成了可互動的3D場景,之前用Claude折騰半天沒搞定的事它一把過。但速度是真慢,等得我泡了兩杯茶。 -
Dorothy868—慢得著急。同樣一個3D迷宮遊戲,GPT-5.6幾分鐘就交付了,K3愣是跑了快半小時。能力強歸強,但這響應速度實在勸退。 -
Daniele87—作為前端開發者,K3的審美確實線上,生成的UI設計感比GPT繫好太多。但程式碼偶爾有邏輯bug,不能完全當甩手掌櫃。 -
AlexaCollins—深度研究能力巨強,讓它分析AI晶片市場,4輪檢索整合了43個來源,最後給了一份帶視覺化圖表的報告,這活兒以前我自己幹至少一週。 -
梁晨貞—讓它審查一個被多輪模型修改過的工程專案,它指出了資料證據缺失、驗證流程不完整,連工程衛生問題都發現了。這種判斷力確實讓人刮目相看。 -
RPowell_2020—一句話生成了可以聯機的胡鬧廚房,全程在網頁版完成,沒用過本地IDE。K3給了一個雲端沙盒,最後還用無頭瀏覽器自己驗證畫面,這體驗跟Codex沒區別了。我一直不用國模就是覺得國模做遊戲差點意思,K3直接打破了我的認知。 -
SGonzales520—開了699的會員,用了一天額度下去20%,這燒錢速度誰能扛得住? -
EricMorris_2022—偏科選手,前端和長程任務確實強,日常聊天體驗一般。讓它寫個簡單指令碼,它思考半分鐘列了12步計劃還附贈效能最佳化建議,殺雞用牛刀。遇到模糊意圖時還喜歡自作主張,幫你決定該做什麼不該做什麼。 -
Sharon.MorganSr—讓它做一個專注App,一句話提示詞:復刻Forest但介面更精美。幾小時後它真做出來了,互動和動效都到位,這活兒以前前端得幹兩三週。 -
MAnderson007—Reddit上吵翻了,有人說這是又一個DeepSeek時刻,也有人吐槽沒人能跑得動這個2.8T的怪物。不過API呼叫的體驗還行,寫程式碼是真的強。 -
俠客758—讓它寫一個帶矛盾需求的大會報名網站——7組衝突需求它全識別出來了,還主動歸類成問題一一確認。這已經不是程式碼能力了,是產品思維。 -
Jennifer.ThomasX—API定價漲了近4倍,輸出15美元/百萬token,國產模型第一次賣到這個價。晶片設計48小時無人干預的demo確實震撼,但普通使用者真用不起。更難受的是上下文長度還分會員等級,256K起步,1M要開最高檔。 -
Patrick_MurphyJr—spt moment!國產開源第一次真正追上來了,雖然只是前端單項,但意義不一樣。 -
盧飛平—矽谷那邊炸鍋了,Frontend Code Arena直接登頂壓過Fable 5。雖然是前端單項,但國產開源模型能坐上這個牌桌本身就是里程碑。 -
Alan_Peterson_Pro—體驗了兩天,一句話總結:K3是個好工具,但只對特定人群好用。前端開發者和深度研究人員會愛死它,普通使用者大機率覺得又慢又貴。一個簡單網頁生成任務它思考幾萬token,燒掉0.25美元,這誰頂得住。 -
saRUI—太能想了!讓它畫一隻騎腳踏車的鵜鶘,它用了16658個token來思考,其中13241個是推理token,最後花了0.25美元。一張圖燒這麼多,真受不了。 -
Peter.Gutierrez168864—貴有貴的道理。雖說是偏科生,但這「偏科」是往天花板方向偏的。用它做前端開發,一天干完以前三天的活,時間換質量,值不值看你做什麼。如果你不是做前端或者深度研究的,建議先觀望,日常對話用便宜模型就行。如果團隊裡有前端開發,那果斷上。 -
324slm—連續15小時最佳化一個GPU核心,把時間從283ms壓到114ms,全程沒人管。這長程執行能力真是絕了,適合掛後臺讓它慢慢跑。 -
Heather.Lewis08—官方承認K3整體仍落後Fable 5和GPT-5.6 Sol,這坦誠勁兒在國產廠商裡少見。測試下來確實,前端編碼第一,但幻覺率從39%漲到51%了。它變得更敢答了,但不知道的也更傾向於硬編,生產環境必須人工核查。 -
自在222—回不去了。用K3寫了幾個前端頁面之後,再用其他模型總覺得差點意思,審美差距擺在那。 -
VIjen—免費獨立遊戲開發的時代比想象中更近!三輪對話、60萬token、3.24美元,K3做了一個CS:GO×Portal克隆遊戲,能直接玩。 -
realAlexandraWhite_pro—2.8萬億引數開源,聽著很猛,但個人開發者根本跑不動。官方推薦64個加速器起步,硬體成本600萬起。開源不等於可用,這話真沒說錯。實際API體驗下來,程式碼質量確實頂級,但輸出token數接近同類均值兩倍,賬單拉起來很快。 -
Frances.Hill_2021—yyds!但這個價我選擇先觀望。 -
SGreenJr—一發布就登頂Arena前端程式碼榜,1679分壓過Fable 5的1631。實測生成了一個3D開放世界遊戲,效果驚豔,但等待過程中我差點睡著。 -
AHughes0071—說是開源但權重還沒放,7月27號才出。不過API試下來確實有Fable那種「魔法感」,尤其是程式碼生成的質量。但錢包在哭。 -
LouisRobertson—剛上線就試了,百萬token上下文果然不是噱頭。把一個4萬行的程式碼庫丟進去讓它重構一個跨12個檔案的函式,全追蹤到了,沒遺漏。但也發現一個問題:超長上下文的穩定度只適配常規企業級專案,面對超大型分散式專案還是有細微遺漏。 -
Ha_shHub—跟前任模型比,K3的上下文視窗真是太香了,做長文件分析不再需要反覆截斷和總結。速度如果能最佳化一下,那就完美了。 -
Keith243—第一天就試了,說實話沒那麼神。普通問答場景跟K2.6差距不大,但價格翻了幾倍。如果不是做前端開發的,真沒必要追這個熱。