Kimi K3

月之暗面规划的 2.5 万亿参数旗舰大模型,主打 100 万 token 超长上下文与原生多模态

深度报告

  • Kimi K3 是月之暗面(Moonshot AI)规划中的下一代旗舰大模型,官方确认将于 2026 年第三季度发布,参数规模达到 2.5 万亿(MoE 混合专家架构),并把上下文窗口扩展到约 100 万 token(约 100 万字)。 它延续了 Kimi 系列在超长文本上的传统优势,同时补齐了原生多模态与更强代码、智能体能力,意在把国产大模型的参数与综合体验天花板再往上抬一截。截至本报告撰写时,K3 仍处于发布前阶段,公开基准多为社区泄露或内部测试,正式能力以发布后为准。

  • 月之暗面由杨植麟创立,是国内最早以「超长上下文」打出差异化的 AI 实验室。Kimi 智能助手 2023 年上线后迅速成为国内最受欢迎的 AI 产品之一,2026 年初 K2.5 模型登顶多个开源榜单,年经常性收入(ARR)突破 1 亿美元,跑通了规模化商业闭环。 K3 发布的背景是公司刚完成新一轮融资,投前估值达到 315 亿美元,资本储备为模型研发、算力扩容和商业化落地提供了支撑。从技术路线看,K2 系列(K2、K2.5、K2.6、K2.7 Code)聚焦长文本与代码能力,K3 则是一次代际跨越,不只是参数翻倍,更是架构范式的升级。

  • Kimi 系列的核心体验围绕「把一整本书、一整套代码库或几十篇论文一次性喂进去」展开。官方标称支持 200 万汉字上下文,K3 将这一能力推向万亿参数级别,宣称约 100 万 token 窗口,意味着上百份合同、整套项目代码或一整本书都能单次上传、无需分段。 配合联网搜索、文件解析(PDF/Word/Excel/PPT)、多文档对比与记忆工具,Kimi 适合长文摘要、合同解读、学术分析和代码工程等场景。K3 进一步引入原生多模态,文本、图像、音视频统一理解,用户可以直接上传图片、音频或视频片段让模型做跨模态推理。 需要注意的是,当前版本「200 万字」更接近训练时见过的最大长度,真实稳定可用的处理窗口在实测中约 12 万至 18 万字,超出后首尾信息会明显衰减,长文本任务仍需主动切片。

  • K3 采用升级扩展 MoE(Expanded MoE)架构,相比 K2 系列的有限专家加静态路由,引入更多细粒度专家与动态自适应路由,让每个 token 更精准匹配专家子网络,在参数暴增的同时控制推理成本。 在 Kimi Linear 线性注意力架构基础上,团队探索了 Kimi Delta Attention 与 KDA 等新思路,目标是用线性注意力改进循环记忆管理、提升硬件效率并降低训练与推理成本。能力亮点集中在三方面:一是 1M 级超长上下文,金融财报、法律卷宗、全链路软件开发的長程任务直接受益;二是原生一体化多模态,文本、图像、音视频统一理解,在竞品多模态仍有短板的窗口期形成差异化;三是更强的代码与智能体能力,K2.6 已在 SWE-Bench 领跑开源模型,K3 有望进一步拉开差距。 社区泄露的基准(未经官方验证)显示 MMLU 92.4、HumanEval 94.1、MATH 88.7、GPQA 72.3、SWE-bench 55.2,推理与代码维度进步明显。

  • K3 的正式定价尚未公布,预计定位高端、高于现有 K2 系列。作为参照,Kimi 开放平台当前 K2.6 的定价为缓存命中每百万 token 1.10 元、输入 6.50 元、输出 27.00 元;K2.5 为缓存命中 0.70 元、输入 4.00 元、输出 21.00 元。 月之暗面的变现路径包括开放平台 API 调用、Kimi 智能助手 C 端订阅,以及面向企业的行业解决方案。公司 ARR 已破 1 亿美元,商业飞轮基本跑通,K3 的发布意在用旗舰能力拉动高端 API 与企业客户,同时巩固 C 端口碑。

  • 正面反馈集中在中文理解与表达自然、超长上下文业界领先、国内可直接访问无需翻墙、免费额度慷慨、文件解析(尤其 PDF)能力强。开发者和研究者喜欢它一次性处理大体积资料的能力,法务、咨询、学术场景用得多。 负面反馈也很明确:英文能力弱于 ChatGPT 与 Claude,图像生成暂时较弱,代码能力不及 Cursor 等专业工具,推理速度有时偏慢;多模态仍处于初级阶段,表格与跨页断行、公式逻辑容易被误读;移动端 App 相比 Web 端功能阉割明显(文件上限 10MB、隐藏高级角色与生成按钮)。 部分用户实测发现长文本超过约 12 万字后首尾衰减显著,关键数据会出现「语义补全」式错误,需要人工二次校验。

  • 业内普遍认为 K3 的 2.5 万亿参数将刷新国产基座模型参数上限,超过 DeepSeek V4 Pro 的 1.6 万亿与百度文心 5.0 的 2.4 万亿,与阿里 Qwen 3.6、智谱 GLM 系列同台竞争。媒体分析指出,国产大模型竞争已进入超大参数、全能模态比拼阶段,K3 的上线将缩小与海外顶级模型的技术差距。 也有冷静声音提醒,参数规模不等于最终能力,训练数据质量、算力调度效率、推理速度与上下文窗口长度都会决定体验;K3 能否在 2.5 万亿体量下真正跑通动态路由与线性注意力,还要看发布后的真实表现。

  • 主要风险有几类。一是「参数至上」叙事的泡沫:参数量翻倍带来更高算力与运营成本,普通用户能否用得上、用得起仍存疑,内部测试的 1M 上下文最终是否向用户开放也悬而未决。 二是能力宣传与现实体验的落差:长上下文稳定窗口远小于标称值,多模态与表格、公式处理仍有明显短板,过度依赖可能引入错误。三是数据合规与过度依赖风险:上传合同、论文等敏感资料时的数据安全,以及把 AI 输出直接用于决策的法律与业务风险,都需要用户自行把关。四是发布节奏与预期管理:K3 从「官宣 Q3」到正式可用之间存在窗口,社区基准多未经验证,需警惕提前狂欢。

  • Kimi K3 适合处理超长文档阅读与摘要、中文内容创作、学术论文分析、合同与法律文件解读、多文件对比整理,以及需要长上下文支撑的代码与研究报告任务的中文用户。它不适合把多模态表格、复杂公式推演或英文重度任务作为核心依赖的用户,这类场景建议配合 Cursor、Claude 或专业工具交叉验证。 使用建议:长文本主动切片到 12 万字以内以保证召回准确;PDF 优先于 Word;涉及法条、财务公式的任务务必人工复核;把 Kimi 当作「第一遍草稿与信息抽取」而非「终审结论」。

  • Kimi K3 是月之暗面从「追赶」走向「并跑」的关键一代,2.5 万亿参数与原生多模态让国产旗舰首次在体量上摸到全球第一梯队门槛;它值得期待,但正式能力、真实上下文上限与定价,都要等第三季度发布后用实测说话。

用户评论

  • 头像
    FlamingoFi879
    参数堆到 2.5 万亿,离谱。

  • 头像
    tINAoLSEN
    等 K3 正式发布,先把长文本这一块啃下来再说,别的都是虚的。

  • 头像
    小鱼387
    我是做投行的,平时几百页招股书直接丢给 Kimi 读,比人工快太多,就是超过十几万字后前面的细节会飘,得自己主动切片才稳。

  • 头像
    ti9v2rnj3
    我做技术文档工程师,天天跟几百页手册打交道。Kimi 现在长文本是真强,但有个坑必须提醒:标称 200 万字,实测稳定窗口大概 12 万字,超了前面关键条款会被「语义补全」改掉。上回我把一份 112 万字的白皮书丢进去问出口限制条款,它把型号差了一代读错。所以我现在的用法是自建脚本按条款锚点切片,每块压到 12 万字内再喂,关键条款提取完整率从 68% 拉到 94%,多花一步但值。

  • 头像
    ThomasGonzalez_202180
    多模态这块还是早期,图片能认个大概,表格一多就乱,复杂公式更是容易瞎解释,真要干活还得配合专业工具交叉验证。

  • 头像
    tbhh3gs
    官方说 100 万字上下文,实测稳定窗口也就十几万,营销话术别全信。

  • 头像
    Rachel.HowardZ798
    我们咨询团队最近用 Kimi 的蜂群模式同时啃 7 份行业报告,让它整合出一份 2000 字综合分析,还主动说明不同报告数据口径差异并给出综合判断,这个交叉验证能力是真香。以前这种活儿得两个人花一下午,现在五分钟出初稿,人工只复核引用。对需要多文档对比的法务、行研、尽调场景,Kimi 基本是刚需了,就是最终结论还是得自己把关,别全信。

  • 头像
    Michael852
    国内能直接开,不用翻墙,这点最香。

  • 头像
    SAnderson168
    代码能力肯定还是赶不上 Cursor,但 K2.6 在 SWE-Bench 已经领跑开源,K3 这代要是把智能体再拉一截,日常开发辅助够用了。

  • 头像
    ypwjalfugp
    移动端功能阉割太狠,10MB 上限劝退。

  • 头像
    EthanWilson_Plus
    说点实在的,免费版长文本会主动简化逻辑链,把 A→B→C→D 压成 A 导致 D,做技术决策很危险。我算了笔账:团队每月处理 20 份以上技术文档,付费版年费远低于因漏参数返工的成本。所以我的建议很直接,重度使用就别在免费版上赌运气,该付费付费,省下的时间就是真金白银。当然 K3 出来后这块会不会改善,还得等实测。

  • 头像
    POwar2024
    英文能力还是弱于 ChatGPT 和 Claude,拿来处理中文长文档没问题,写英文报告就露怯了。

  • 头像
    William839
    K3 要是定价别太贵就入手了,毕竟长文本这块确实无人能打。

  • 头像
    TinaCrmpbell
    PDF 解析明显强于 Word,复杂表格还是会丢列间关系,上传 Excel 容易把公式逻辑读偏,财务类任务务必人工复核。

  • 头像
    SAwal
    等第三季度实测。