DeepSeek V4.5
深度求索 2026 年 7 月推出的旗舰大模型迭代版,强化代码、中文长文本与多轮一致性,延续开源与地板价打法
深度报告
-
DeepSeek V4.5 是深度求索在 2026 年 7 月初推出的旗舰大模型迭代版本,定位延续 V4 家族「开源、超长上下文、地板价」的一贯打法。这一版主要把力气花在代码生成、中文长文本理解和多轮对话一致性三个方向上,依旧免费向网页端与 App 端开放,API 侧则复用 V4 系列的调用入口。它不是一个重新讲大故事的版本,更像是一次「把已经很强的地方再推一档」的务实更新,对成本敏感的开发者和重度文字工作者尤其友好。
-
DeepSeek 背后的公司是位于杭州的深度求索人工智能基础技术研究有限公司,自 2023 年起就走开源路线,先后放出 DeepSeek LLM、Coder、Math、V2、V3、R1 等系列,靠极致的训练与推理效率在开源阵营站稳脚跟。2026 年 4 月 24 日,V4 预览版正式上线并同步开源,一口气给出两个规格:对标顶级闭源的 V4-Pro(约 1.6 万亿总参数、每次激活约 490 亿)和经济高效的 V4-Flash(约 2840 亿总参数、每次激活约 130 亿),均采用 MIT 协议全量开源。V4.5 则在其后两三个月内以低调方式放出,社区周报显示其上线时间约在 7 月 2 日前后,没有开发布会,延续了 DeepSeek「不预告、直接上」的风格。
-
V4.5 沿用了 V4 家族的三档推理强度设计:非思考模式(Non-think)直出、常规深度思考(Think High)与最强思考(Think Max),开发者可通过 API 的 reasoning_effort 参数调节强度,复杂 Agent 场景官方建议直接开 Max。架构层面,V4 系引入了在 token 维度做压缩的混合注意力机制,结合自研的 DSA 稀疏注意力、Engram 条件记忆(把静态知识与动态推理分离,长文本检索准确率从 84.2% 提到 97.0%)以及 mHC 流形约束超连接(把万亿级参数的层间信号放大压到 2 倍以内),从而在长上下文下大幅降低算力与显存开销。V4 系的上下文窗口达到 100 万 token 并设为全系标配;而聚合类模型目录对 V4.5 的记载为 256K 上下文、最大 33K 输出,具体口径以官方后续公告为准。社区反馈里,V4.5 的代码生成(HumanEval 被提及再创新高)、中文长文本理解和多轮一致性是这次提升最明显的三块。
-
DeepSeek 的定价哲学一直是「打穿底」。网页端 chat.deepseek.com 与官方 App 面向个人用户免费对话,这是它和 ChatGPT、Claude 的付费订阅正面错位的根本武器。API 侧按 token 计费,官方定价页显示 V4-Flash 每百万 token 输入(缓存命中)0.02 元、未命中 1 元、输出 2 元;V4-Pro 分别为 0.025 元、3 元、6 元,并发上限 2500 / 500。海外聚合目录对 V4.5 的托管 API 报价为输入 0.5 美元、输出 1.1 美元每百万 token,折合人民币仍属地板价。一个需要留意的时间点是:旧的 deepseek-chat 与 deepseek-reasoner 两个模型名将在 2026 年 7 月 24 日弃用,分别指向 V4-Flash 的非思考与思考模式,生产环境需要在此之前完成 model 参数迁移。模型权重以 MIT 协议在 HuggingFace 与 ModelScope 开源,可本地或私有云部署,边际成本只剩基础设施。
-
普通用户的真实体验里,正面的部分相当一致。100 万上下文被反复夸「太实用」——把十几份文档一次性丢进去让它通读再回答,长合同、财报、整本书的分析从大几千的人工成本降到几十块。代码能力也得到认可,Flash 版日常脚本够用,Pro 版处理复杂任务更稳,有用户反馈一个批量订单处理脚本 15 分钟跑通。便宜是另一张王牌,高强度使用一个月账单不到 30 元,而同类国外模型往往两三百起步。中文语感也被认为优于国外模型,能准确理解「毛利卡得死」这类本土表达。 负面反馈同样集中。最常被点名的是「天气卡片问题」:让它查结构化数据(天气、股价)时偶尔会编数字,当助手没问题,当权威就会翻车。复杂常识推理仍有缺口,经典的「绝望的父亲」红绿色盲遗传题 V4 首轮没抓到核心逻辑。更长上下文的有效利用率也遭质疑,第三方实测在百万字文本里只能稳定识别约 10 万 token 内的标记,有效内容远不到宣称的四分之一。此外,简单任务上存在「过度思考」、答案冗余,模型本质仍是纯文本、没有多模态能力。
-
放到全球阵营里看,DeepSeek V4 系在 Agentic Coding 评测中拿下开源模型最佳,内部员工实测体验优于 Sonnet 4.5、交付质量接近 Opus 4.6 非思考模式,但和 Opus 4.6 思考模式仍有差距;世界知识测评大幅领先开源模型、仅稍逊 Gemini-Pro-3.1;数学与竞赛代码比肩顶级闭源。它的真正杀伤力在成本:把 GPT-5.5 约 30 美元每百万输出的价格打到了不到 1 美元,被业内称为「定价哲学的正面碰撞」。更关键的是,V4 从底层架构就为国产算力(华为昇腾 950PR、寒武纪)做了全链路适配,国产芯片推理速度较 V3 提升约 35 倍,被视为中国 AI 全栈自主可控闭环的关键一环。
-
围绕 V4.5 有几个值得留意的争议点。一是有效上下文的落差:宣称 100 万 token,实际可用远小于此,对依赖「整库代码、整本书」场景的用户可能不及预期。二是多模态缺失:在同期竞品把视觉、视频作为核心卖点时,DeepSeek 仍是纯文本模型,复杂多模态 Agent 场景落后。三是 V4.5 公开基准稀少——目前能查到的具体跑分多来自聚合目录与社区周报,权威第三方评测尚不充分,引用时需标注为待验证。四是安全表现:越狱测试中它能完成基础拦截,但缺乏主动识别劫持指令的安全推理意识,措辞上用「无法」而非「不会」,可信度细节仍有打磨空间。五是地缘政治维度:受美国出口管制影响,预训练仍依赖英伟达,但后训练到推理已深度绑定国产芯片,这既是战略资产,也意味着产能与降价节奏和国产算力供给强相关。
-
如果你是重度文字工作者——编辑、研究员、学生、律师、分析师,长文档处理能力能省下大量时间;如果你是开发者,代码辅助、调试、写注释、生成测试用例的效率和准确率都在第一梯队;如果你是成本敏感的个人用户,免费版已经完全够用。不建议的场景是:需要高级图片 / 视频生成或复杂多模态任务的,目前 DeepSeek 还满足不了;追求最顶尖深度推理或需要成熟插件生态、企业级 SLA 的,闭源模型仍是更稳的选择;把 AI 当权威数据源、不做核验就直接采用的,要警惕它的幻觉倾向。
-
DeepSeek V4.5 没有讲一个宏大的新故事,而是把「好用、便宜、开源」这三个已经很强的支点又往前推了一档,尤其在代码、中文长文本和多轮一致性上给了用户实打实的体感提升。它的短板也清楚:有效长上下文和纯文本形态仍是与顶级闭源拉开差距的地方。对绝大多数中国用户而言,它是一个值得首选、且几乎没有上手门槛的旗舰模型。
用户评论
-
JerryTurnerSr59—本地部署党狂喜,MIT 协议直接拉权重,消费级显卡跑量化版够用了,私有化部署没有后顾之忧。我们公司因为数据合规要求不能走公有云 API,之前一直卡在模型授权上,V4 系 MIT 协议一开放,法务那边直接绿灯,现在内部推理集群跑的是量化版 Pro,延迟和成本都比采购闭源 API 划算太多,对公司合规和成本都太友好了。 -
4pa0w—整体瑕不掩瑜,好用又便宜还开源,国产模型能做到这个程度,已经不是凭爱国滤镜能解释的了,日常生产我愿意把它当主力。 -
ticklishpeacock996—和 Claude Code 联动做 Agent,简单任务挺好,复杂工程里偶尔不听话,没确认就执行了,工程化细节还得打磨,生产环境记得加护栏。 -
qvhqs2—推理成本控制得离谱,同样质量的活儿,闭源那边动辄几十刀,它折合成人民币连一美元都不到,定价是把对手往死里卷。我们算过一笔账,同样一个月的客服意图分类加摘要任务,走 GPT 那套要两千多美元,走 DeepSeek API 不到二十块人民币,中小团队直接受益,省下来的预算够多养半个运营了。当然复杂推理该上闭源还是上闭源,不能一概而论。 -
于鹏敏—唯一让我头大的是「天气卡片问题」,让它查竞品价格它偶尔会编数字,看起来特别合理,一核对全是假的,关键数据还是得自己过一遍。 -
MatthewFisher—纯文本模型这点有点遗憾,现在别人都在卷多模态,它连图都看不了,做视觉相关的活还是得切别的工具,期待后面补上。 -
Amanda.Gomez_Max3—复杂推理还是有差距,那个红绿色盲的遗传题它第一轮没转过弯来,官方自己都承认了,当助手没问题别当权威,关键结论自己拍板。 -
ScottTaylor_20225—免费版先用着,长文档分析太香了,三十多页 PDF 直接丢进去问三个问题,它真能逐段引用,这点比国外模型省不少钱。 -
SSimmons21—百万上下文宣传很猛,但实际塞一整本书进去,到后面它还是会有点记混,有效长度远没有一百万那么理想。我自己做过「大海捞针」测试,在接近百万字的小说里埋标记,它能稳定认出来的基本只有前十万字左右,越往后错误率越高。这点得实事求是,别被参数带节奏,真要处理超长文档还是得分段或者自己管好检索。 -
heavytiger177—V4.5 这次中文长文本理解提升明显,多轮对话也不容易跑偏,日常写东西、改稿子体验比上一个版本顺。我专门拿同一篇五千字的稿子做 A/B,上一版经常在第二轮把前面定的语气忘了,这版基本能记住「保持口语化、别加 emoji」这种细要求,对内容工作者是实打实的提升,不用每轮都重新交代背景,省了不少提示词。 -
PGonzalez—V4.5 写 Python 数据处理脚本是真的顺,我那个批量订单清洗的活,以前靠人肉要两小时,现在一遍过,十五分钟搞定。 -
ChainMax_n—代码能力是真的强,Flash 日常够用,Pro 处理复杂任务更稳,团队里已经把日常 coding 切到它了。上周让它重构一个三千行的历史包袱模块,它先把调用关系画出来再逐文件改,比新来的同事还稳,唯一槽点是偶尔会多写一些防御性代码显得啰嗦,但正确性没得说。性价比这一项没什么可挑的,同样的质量闭源那边报价能翻几十倍。 -
Jacqueline.Edwards_2020—API 价格太离谱了,Flash 输出才两块一百万 token,我高强度用了一个月账单不到三十块,以前用 ChatGPT 至少两三百。 -
Dennis_Evans766—简单问题它会想太多,啰啰嗦嗦写一大堆,关掉思考模式才利索,希望后续能更聪明地判断要不要深想。 -
Jacqueline_Perez—中文语感确实比 GPT 好,我说「这个品毛利卡得死」,它一下就懂是利润率低,不会给我整成产品死了的笑话。 -
DianeGutierrez—半小时生成一份带引用的行业分析初稿,对调研太友好了,虽然深度不够但可以当脚手架,省了我至少两小时。我一般让它先列框架和找公开数据源,再自己补一手内部数据交叉验证,这样既不担心它瞎编,又能把机械的素材搜集外包出去。说白了它就是个不知疲倦的初级分析师,结论你自己拍板就行。