In-depth Report
-
Kimi K3 是月之暗面(Moonshot AI)规划中的下一代旗舰大模型,官方确认将于 2026 年第三季度发布,参数规模达到 2.5 万亿(MoE 混合专家架构),并把上下文窗口扩展到约 100 万 token(约 100 万字)。 它延续了 Kimi 系列在超长文本上的传统优势,同时补齐了原生多模态与更强代码、智能体能力,意在把国产大模型的参数与综合体验天花板再往上抬一截。截至本报告撰写时,K3 仍处于发布前阶段,公开基准多为社区泄露或内部测试,正式能力以发布后为准。
-
月之暗面由杨植麟创立,是国内最早以「超长上下文」打出差异化的 AI 实验室。Kimi 智能助手 2023 年上线后迅速成为国内最受欢迎的 AI 产品之一,2026 年初 K2.5 模型登顶多个开源榜单,年经常性收入(ARR)突破 1 亿美元,跑通了规模化商业闭环。 K3 发布的背景是公司刚完成新一轮融资,投前估值达到 315 亿美元,资本储备为模型研发、算力扩容和商业化落地提供了支撑。从技术路线看,K2 系列(K2、K2.5、K2.6、K2.7 Code)聚焦长文本与代码能力,K3 则是一次代际跨越,不只是参数翻倍,更是架构范式的升级。
-
Kimi 系列的核心体验围绕「把一整本书、一整套代码库或几十篇论文一次性喂进去」展开。官方标称支持 200 万汉字上下文,K3 将这一能力推向万亿参数级别,宣称约 100 万 token 窗口,意味着上百份合同、整套项目代码或一整本书都能单次上传、无需分段。 配合联网搜索、文件解析(PDF/Word/Excel/PPT)、多文档对比与记忆工具,Kimi 适合长文摘要、合同解读、学术分析和代码工程等场景。K3 进一步引入原生多模态,文本、图像、音视频统一理解,用户可以直接上传图片、音频或视频片段让模型做跨模态推理。 需要注意的是,当前版本「200 万字」更接近训练时见过的最大长度,真实稳定可用的处理窗口在实测中约 12 万至 18 万字,超出后首尾信息会明显衰减,长文本任务仍需主动切片。
-
K3 采用升级扩展 MoE(Expanded MoE)架构,相比 K2 系列的有限专家加静态路由,引入更多细粒度专家与动态自适应路由,让每个 token 更精准匹配专家子网络,在参数暴增的同时控制推理成本。 在 Kimi Linear 线性注意力架构基础上,团队探索了 Kimi Delta Attention 与 KDA 等新思路,目标是用线性注意力改进循环记忆管理、提升硬件效率并降低训练与推理成本。能力亮点集中在三方面:一是 1M 级超长上下文,金融财报、法律卷宗、全链路软件开发的長程任务直接受益;二是原生一体化多模态,文本、图像、音视频统一理解,在竞品多模态仍有短板的窗口期形成差异化;三是更强的代码与智能体能力,K2.6 已在 SWE-Bench 领跑开源模型,K3 有望进一步拉开差距。 社区泄露的基准(未经官方验证)显示 MMLU 92.4、HumanEval 94.1、MATH 88.7、GPQA 72.3、SWE-bench 55.2,推理与代码维度进步明显。
-
K3 的正式定价尚未公布,预计定位高端、高于现有 K2 系列。作为参照,Kimi 开放平台当前 K2.6 的定价为缓存命中每百万 token 1.10 元、输入 6.50 元、输出 27.00 元;K2.5 为缓存命中 0.70 元、输入 4.00 元、输出 21.00 元。 月之暗面的变现路径包括开放平台 API 调用、Kimi 智能助手 C 端订阅,以及面向企业的行业解决方案。公司 ARR 已破 1 亿美元,商业飞轮基本跑通,K3 的发布意在用旗舰能力拉动高端 API 与企业客户,同时巩固 C 端口碑。
-
正面反馈集中在中文理解与表达自然、超长上下文业界领先、国内可直接访问无需翻墙、免费额度慷慨、文件解析(尤其 PDF)能力强。开发者和研究者喜欢它一次性处理大体积资料的能力,法务、咨询、学术场景用得多。 负面反馈也很明确:英文能力弱于 ChatGPT 与 Claude,图像生成暂时较弱,代码能力不及 Cursor 等专业工具,推理速度有时偏慢;多模态仍处于初级阶段,表格与跨页断行、公式逻辑容易被误读;移动端 App 相比 Web 端功能阉割明显(文件上限 10MB、隐藏高级角色与生成按钮)。 部分用户实测发现长文本超过约 12 万字后首尾衰减显著,关键数据会出现「语义补全」式错误,需要人工二次校验。
-
业内普遍认为 K3 的 2.5 万亿参数将刷新国产基座模型参数上限,超过 DeepSeek V4 Pro 的 1.6 万亿与百度文心 5.0 的 2.4 万亿,与阿里 Qwen 3.6、智谱 GLM 系列同台竞争。媒体分析指出,国产大模型竞争已进入超大参数、全能模态比拼阶段,K3 的上线将缩小与海外顶级模型的技术差距。 也有冷静声音提醒,参数规模不等于最终能力,训练数据质量、算力调度效率、推理速度与上下文窗口长度都会决定体验;K3 能否在 2.5 万亿体量下真正跑通动态路由与线性注意力,还要看发布后的真实表现。
-
主要风险有几类。一是「参数至上」叙事的泡沫:参数量翻倍带来更高算力与运营成本,普通用户能否用得上、用得起仍存疑,内部测试的 1M 上下文最终是否向用户开放也悬而未决。 二是能力宣传与现实体验的落差:长上下文稳定窗口远小于标称值,多模态与表格、公式处理仍有明显短板,过度依赖可能引入错误。三是数据合规与过度依赖风险:上传合同、论文等敏感资料时的数据安全,以及把 AI 输出直接用于决策的法律与业务风险,都需要用户自行把关。四是发布节奏与预期管理:K3 从「官宣 Q3」到正式可用之间存在窗口,社区基准多未经验证,需警惕提前狂欢。
-
Kimi K3 适合处理超长文档阅读与摘要、中文内容创作、学术论文分析、合同与法律文件解读、多文件对比整理,以及需要长上下文支撑的代码与研究报告任务的中文用户。它不适合把多模态表格、复杂公式推演或英文重度任务作为核心依赖的用户,这类场景建议配合 Cursor、Claude 或专业工具交叉验证。 使用建议:长文本主动切片到 12 万字以内以保证召回准确;PDF 优先于 Word;涉及法条、财务公式的任务务必人工复核;把 Kimi 当作「第一遍草稿与信息抽取」而非「终审结论」。
-
Kimi K3 是月之暗面从「追赶」走向「并跑」的关键一代,2.5 万亿参数与原生多模态让国产旗舰首次在体量上摸到全球第一梯队门槛;它值得期待,但正式能力、真实上下文上限与定价,都要等第三季度发布后用实测说话。
User Reviews
-
Sandra_HarrisZ—卡成PPT,真退了。 -
WilliamButler369—太强了!前端编码直接登顶,国产模型第一次这么硬气。 -
BrandonNguyen007—试用了几天K3,前端能力确实顶,一个提示词生成了可交互的3D场景,之前用Claude折腾半天没搞定的事它一把过。但速度是真慢,等得我泡了两杯茶。 -
Dorothy868—慢得着急。同样一个3D迷宫游戏,GPT-5.6几分钟就交付了,K3愣是跑了快半小时。能力强归强,但这响应速度实在劝退。 -
Daniele87—作为前端开发者,K3的审美确实在线,生成的UI设计感比GPT系好太多。但代码偶尔有逻辑bug,不能完全当甩手掌柜。 -
AlexaCollins—深度研究能力巨强,让它分析AI芯片市场,4轮检索整合了43个来源,最后给了一份带可视化图表的报告,这活儿以前我自己干至少一周。 -
梁晨贞—让它审查一个被多轮模型修改过的工程项目,它指出了数据证据缺失、验证流程不完整,连工程卫生问题都发现了。这种判断力确实让人刮目相看。 -
RPowell_2020—一句话生成了可以联机的胡闹厨房,全程在网页版完成,没用过本地IDE。K3给了一个云端沙盒,最后还用无头浏览器自己验证画面,这体验跟Codex没区别了。我一直不用国模就是觉得国模做游戏差点意思,K3直接打破了我的认知。 -
SGonzales520—开了699的会员,用了一天额度下去20%,这烧钱速度谁能扛得住? -
EricMorris_2022—偏科选手,前端和长程任务确实强,日常聊天体验一般。让它写个简单脚本,它思考半分钟列了12步计划还附赠性能优化建议,杀鸡用牛刀。遇到模糊意图时还喜欢自作主张,帮你决定该做什么不该做什么。 -
Sharon.MorganSr—让它做一个专注App,一句话提示词:复刻Forest但界面更精美。几小时后它真做出来了,交互和动效都到位,这活儿以前前端得干两三周。 -
MAnderson007—Reddit上吵翻了,有人说这是又一个DeepSeek时刻,也有人吐槽没人能跑得动这个2.8T的怪物。不过API调用的体验还行,写代码是真的强。 -
侠客758—让它写一个带矛盾需求的大会报名网站——7组冲突需求它全识别出来了,还主动归类成问题一一确认。这已经不是代码能力了,是产品思维。 -
Jennifer.ThomasX—API定价涨了近4倍,输出15美元/百万token,国产模型第一次卖到这个价。芯片设计48小时无人干预的demo确实震撼,但普通用户真用不起。更难受的是上下文长度还分会员等级,256K起步,1M要开最高档。 -
Patrick_MurphyJr—spt moment!国产开源第一次真正追上来了,虽然只是前端单项,但意义不一样。 -
卢飞平—硅谷那边炸锅了,Frontend Code Arena直接登顶压过Fable 5。虽然是前端单项,但国产开源模型能坐上这个牌桌本身就是里程碑。 -
Alan_Peterson_Pro—体验了两天,一句话总结:K3是个好工具,但只对特定人群好用。前端开发者和深度研究人员会爱死它,普通用户大概率觉得又慢又贵。一个简单网页生成任务它思考几万token,烧掉0.25美元,这谁顶得住。 -
saRUI—太能想了!让它画一只骑自行车的鹈鹕,它用了16658个token来思考,其中13241个是推理token,最后花了0.25美元。一张图烧这么多,真受不了。 -
Peter.Gutierrez168864—贵有贵的道理。虽说是偏科生,但这「偏科」是往天花板方向偏的。用它做前端开发,一天干完以前三天的活,时间换质量,值不值看你做什么。如果你不是做前端或者深度研究的,建议先观望,日常对话用便宜模型就行。如果团队里有前端开发,那果断上。 -
324slm—连续15小时优化一个GPU内核,把时间从283ms压到114ms,全程没人管。这长程执行能力真是绝了,适合挂后台让它慢慢跑。 -
Heather.Lewis08—官方承认K3整体仍落后Fable 5和GPT-5.6 Sol,这坦诚劲儿在国产厂商里少见。测试下来确实,前端编码第一,但幻觉率从39%涨到51%了。它变得更敢答了,但不知道的也更倾向于硬编,生产环境必须人工核查。 -
自在222—回不去了。用K3写了几个前端页面之后,再用其他模型总觉得差点意思,审美差距摆在那。 -
VIjen—免费独立游戏开发的时代比想象中更近!三轮对话、60万token、3.24美元,K3做了一个CS:GO×Portal克隆游戏,能直接玩。 -
realAlexandraWhite_pro—2.8万亿参数开源,听着很猛,但个人开发者根本跑不动。官方推荐64个加速器起步,硬件成本600万起。开源不等于可用,这话真没说错。实际API体验下来,代码质量确实顶级,但输出token数接近同类均值两倍,账单拉起来很快。 -
Frances.Hill_2021—yyds!但这个价我选择先观望。 -
SGreenJr—一发布就登顶Arena前端代码榜,1679分压过Fable 5的1631。实测生成了一个3D开放世界游戏,效果惊艳,但等待过程中我差点睡着。 -
AHughes0071—说是开源但权重还没放,7月27号才出。不过API试下来确实有Fable那种「魔法感」,尤其是代码生成的质量。但钱包在哭。 -
LouisRobertson—刚上线就试了,百万token上下文果然不是噱头。把一个4万行的代码库丢进去让它重构一个跨12个文件的函数,全追踪到了,没遗漏。但也发现一个问题:超长上下文的稳定度只适配常规企业级项目,面对超大型分布式项目还是有细微遗漏。 -
Ha_shHub—跟前任模型比,K3的上下文窗口真是太香了,做长文档分析不再需要反复截断和总结。速度如果能优化一下,那就完美了。 -
Keith243—第一天就试了,说实话没那么神。普通问答场景跟K2.6差距不大,但价格翻了几倍。如果不是做前端开发的,真没必要追这个热。