DeepSeek V4.5

深度求索 2026 年 7 月推出的旗艦大模型迭代版,強化程式碼、中文長文字與多輪一致性,延續開源與地板價打法

深度報告

  • DeepSeek V4.5 是深度求索在 2026 年 7 月初推出的旗艦大模型迭代版本,定位延續 V4 家族「開源、超長上下文、地板價」的一貫打法。這一版主要把力氣花在程式碼生成、中文長文字理解和多輪對話一致性三個方向上,依舊免費向網頁端與 App 端開放,API 側則複用 V4 系列的呼叫入口。它不是一個重新講大故事的版本,更像是一次「把已經很強的地方再推一檔」的務實更新,對成本敏感的開發者和重度文字工作者尤其友好。

  • DeepSeek 背後的公司是位於杭州的深度求索人工智慧基礎技術研究有限公司,自 2023 年起就走開源路線,先後放出 DeepSeek LLM、Coder、Math、V2、V3、R1 等系列,靠極致的訓練與推理效率在開源陣營站穩腳跟。2026 年 4 月 24 日,V4 預覽版正式上線並同步開源,一口氣給出兩個規格:對標頂級閉源的 V4-Pro(約 1.6 萬億總引數、每次啟用約 490 億)和經濟高效的 V4-Flash(約 2840 億總引數、每次啟用約 130 億),均採用 MIT 協議全量開源。V4.5 則在其後兩三個月內以低調方式放出,社群週報顯示其上線時間約在 7 月 2 日前後,沒有開釋出會,延續了 DeepSeek「不預告、直接上」的風格。

  • V4.5 沿用了 V4 家族的三檔推理強度設計:非思考模式(Non-think)直出、常規深度思考(Think High)與最強思考(Think Max),開發者可透過 API 的 reasoning_effort 引數調節強度,複雜 Agent 場景官方建議直接開 Max。架構層面,V4 系引入了在 token 維度做壓縮的混合注意力機制,結合自研的 DSA 稀疏注意力、Engram 條件記憶(把靜態知識與動態推理分離,長文字檢索準確率從 84.2% 提到 97.0%)以及 mHC 流形約束超連線(把萬億級引數的層間訊號放大壓到 2 倍以內),從而在長上下文下大幅降低算力與視訊記憶體開銷。V4 系的上下文視窗達到 100 萬 token 並設為全系標配;而聚合類模型目錄對 V4.5 的記載為 256K 上下文、最大 33K 輸出,具體口徑以官方後續公告為準。社群反饋裡,V4.5 的程式碼生成(HumanEval 被提及再創新高)、中文長文字理解和多輪一致性是這次提升最明顯的三塊。

  • DeepSeek 的定價哲學一直是「打穿底」。網頁端 chat.deepseek.com 與官方 App 面向個人使用者免費對話,這是它和 ChatGPT、Claude 的付費訂閱正面錯位的根本武器。API 側按 token 計費,官方定價頁顯示 V4-Flash 每百萬 token 輸入(快取命中)0.02 元、未命中 1 元、輸出 2 元;V4-Pro 分別為 0.025 元、3 元、6 元,併發上限 2500 / 500。海外聚合目錄對 V4.5 的託管 API 報價為輸入 0.5 美元、輸出 1.1 美元每百萬 token,摺合人民幣仍屬地板價。一個需要留意的時間點是:舊的 deepseek-chat 與 deepseek-reasoner 兩個模型名將在 2026 年 7 月 24 日棄用,分別指向 V4-Flash 的非思考與思考模式,生產環境需要在此之前完成 model 引數遷移。模型權重以 MIT 協議在 HuggingFace 與 ModelScope 開源,可本地或私有云部署,邊際成本只剩基礎設施。

  • 普通使用者的真實體驗裡,正面的部分相當一致。100 萬上下文被反覆誇「太實用」——把十幾份文件一次性丟進去讓它通讀再回答,長合同、財報、整本書的分析從大幾千的人工成本降到幾十塊。程式碼能力也得到認可,Flash 版日常指令碼夠用,Pro 版處理複雜任務更穩,有使用者反饋一個批次訂單處理指令碼 15 分鐘跑通。便宜是另一張王牌,高強度使用一個月賬單不到 30 元,而同類國外模型往往兩三百起步。中文語感也被認為優於國外模型,能準確理解「毛利卡得死」這類本土表達。 負面反饋同樣集中。最常被點名的是「天氣卡片問題」:讓它查結構化資料(天氣、股價)時偶爾會編數字,當助手沒問題,當權威就會翻車。複雜常識推理仍有缺口,經典的「絕望的父親」紅綠色盲遺傳題 V4 首輪沒抓到核心邏輯。更長上下文的有效利用率也遭質疑,第三方實測在百萬字文字里只能穩定識別約 10 萬 token 內的標記,有效內容遠不到宣稱的四分之一。此外,簡單任務上存在「過度思考」、答案冗餘,模型本質仍是純文字、沒有多模態能力。

  • 放到全球陣營裡看,DeepSeek V4 系在 Agentic Coding 評測中拿下開源模型最佳,內部員工實測體驗優於 Sonnet 4.5、交付質量接近 Opus 4.6 非思考模式,但和 Opus 4.6 思考模式仍有差距;世界知識測評大幅領先開源模型、僅稍遜 Gemini-Pro-3.1;數學與競賽程式碼比肩頂級閉源。它的真正殺傷力在成本:把 GPT-5.5 約 30 美元每百萬輸出的價格打到了不到 1 美元,被業內稱為「定價哲學的正面碰撞」。更關鍵的是,V4 從底層架構就為國產算力(華為昇騰 950PR、寒武紀)做了全鏈路適配,國產晶片推理速度較 V3 提升約 35 倍,被視為中國 AI 全棧自主可控閉環的關鍵一環。

  • 圍繞 V4.5 有幾個值得留意的爭議點。一是有效上下文的落差:宣稱 100 萬 token,實際可用遠小於此,對依賴「整庫程式碼、整本書」場景的使用者可能不及預期。二是多模態缺失:在同期競品把視覺、影片作為核心賣點時,DeepSeek 仍是純文字模型,複雜多模態 Agent 場景落後。三是 V4.5 公開基準稀少——目前能查到的具體跑分多來自聚合目錄與社群週報,權威第三方評測尚不充分,引用時需標註為待驗證。四是安全表現:越獄測試中它能完成基礎攔截,但缺乏主動識別劫持指令的安全推理意識,措辭上用「無法」而非「不會」,可信度細節仍有打磨空間。五是地緣政治維度:受美國出口管制影響,預訓練仍依賴英偉達,但後訓練到推理已深度繫結國產晶片,這既是戰略資產,也意味著產能與降價節奏和國產算力供給強相關。

  • 如果你是重度文字工作者——編輯、研究員、學生、律師、分析師,長文件處理能力能省下大量時間;如果你是開發者,程式碼輔助、除錯、寫註釋、生成測試用例的效率和準確率都在第一梯隊;如果你是成本敏感的個人使用者,免費版已經完全夠用。不建議的場景是:需要高階圖片 / 影片生成或複雜多模態任務的,目前 DeepSeek 還滿足不了;追求最頂尖深度推理或需要成熟外掛生態、企業級 SLA 的,閉源模型仍是更穩的選擇;把 AI 當權威資料來源、不做核驗就直接採用的,要警惕它的幻覺傾向。

  • DeepSeek V4.5 沒有講一個宏大的新故事,而是把「好用、便宜、開源」這三個已經很強的支點又往前推了一檔,尤其在程式碼、中文長文字和多輪一致性上給了使用者實打實的體感提升。它的短板也清楚:有效長上下文和純文字形態仍是與頂級閉源拉開差距的地方。對絕大多數中國使用者而言,它是一個值得首選、且幾乎沒有上手門檻的旗艦模型。

使用者評論

  • 頭像
    JerryTurnerSr59
    本地部署黨狂喜,MIT 協議直接拉權重,消費級顯示卡跑量化版夠用了,私有化部署沒有後顧之憂。我們公司因為資料合規要求不能走公有云 API,之前一直卡在模型授權上,V4 系 MIT 協議一開放,法務那邊直接綠燈,現在內部推理叢集跑的是量化版 Pro,延遲和成本都比採購閉源 API 划算太多,對公司合規和成本都太友好了。

  • 頭像
    4pa0w
    整體瑕不掩瑜,好用又便宜還開源,國產模型能做到這個程度,已經不是憑愛國濾鏡能解釋的了,日常生產我願意把它當主力。

  • 頭像
    ticklishpeacock996
    和 Claude Code 聯動做 Agent,簡單任務挺好,複雜工程裡偶爾不聽話,沒確認就執行了,工程化細節還得打磨,生產環境記得加護欄。

  • 頭像
    qvhqs2
    推理成本控制得離譜,同樣質量的活兒,閉源那邊動輒幾十刀,它摺合成人民幣連一美元都不到,定價是把對手往死裡卷。我們算過一筆賬,同樣一個月的客服意圖分類加摘要任務,走 GPT 那套要兩千多美元,走 DeepSeek API 不到二十塊人民幣,中小團隊直接受益,省下來的預算夠多養半個運營了。當然複雜推理該上閉源還是上閉源,不能一概而論。

  • 頭像
    於鵬敏
    唯一讓我頭大的是「天氣卡片問題」,讓它查競品價格它偶爾會編數字,看起來特別合理,一核對全是假的,關鍵資料還是得自己過一遍。

  • 頭像
    MatthewFisher
    純文字模型這點有點遺憾,現在別人都在卷多模態,它連圖都看不了,做視覺相關的活還是得切別的工具,期待後面補上。

  • 頭像
    Amanda.Gomez_Max3
    複雜推理還是有差距,那個紅綠色盲的遺傳題它第一輪沒轉過彎來,官方自己都承認了,當助手沒問題別當權威,關鍵結論自己拍板。

  • 頭像
    ScottTaylor_20225
    免費版先用著,長文件分析太香了,三十多頁 PDF 直接丟進去問三個問題,它真能逐段引用,這點比國外模型省不少錢。

  • 頭像
    SSimmons21
    百萬上下文宣傳很猛,但實際塞一整本書進去,到後面它還是會有點記混,有效長度遠沒有一百萬那麼理想。我自己做過「大海撈針」測試,在接近百萬字的小說裡埋標記,它能穩定認出來的基本只有前十萬字左右,越往後錯誤率越高。這點得實事求是,別被引數帶節奏,真要處理超長文件還是得分段或者自己管好檢索。

  • 頭像
    heavytiger177
    V4.5 這次中文長文字理解提升明顯,多輪對話也不容易跑偏,日常寫東西、改稿子體驗比上一個版本順。我專門拿同一篇五千字的稿子做 A/B,上一版經常在第二輪把前面定的語氣忘了,這版基本能記住「保持口語化、別加 emoji」這種細要求,對內容工作者是實打實的提升,不用每輪都重新交代背景,省了不少提示詞。

  • 頭像
    PGonzalez
    V4.5 寫 Python 資料處理指令碼是真的順,我那個批次訂單清洗的活,以前靠人肉要兩小時,現在一遍過,十五分鐘搞定。

  • 頭像
    ChainMax_n
    程式碼能力是真的強,Flash 日常夠用,Pro 處理複雜任務更穩,團隊裡已經把日常 coding 切到它了。上週讓它重構一個三千行的歷史包袱模組,它先把呼叫關係畫出來再逐檔案改,比新來的同事還穩,唯一槽點是偶爾會多寫一些防禦性程式碼顯得囉嗦,但正確性沒得說。價效比這一項沒什麼可挑的,同樣的質量閉源那邊報價能翻幾十倍。

  • 頭像
    Jacqueline.Edwards_2020
    API 價格太離譜了,Flash 輸出才兩塊一百萬 token,我高強度用了一個月賬單不到三十塊,以前用 ChatGPT 至少兩三百。

  • 頭像
    Dennis_Evans766
    簡單問題它會想太多,囉囉嗦嗦寫一大堆,關掉思考模式才利索,希望後續能更聰明地判斷要不要深想。

  • 頭像
    Jacqueline_Perez
    中文語感確實比 GPT 好,我說「這個品毛利卡得死」,它一下就懂是利潤率低,不會給我整成產品死了的笑話。

  • 頭像
    DianeGutierrez
    半小時生成一份帶引用的行業分析初稿,對調研太友好了,雖然深度不夠但可以當腳手架,省了我至少兩小時。我一般讓它先列框架和找公開資料來源,再自己補一手內部資料交叉驗證,這樣既不擔心它瞎編,又能把機械的素材蒐集外包出去。說白了它就是個不知疲倦的初級分析師,結論你自己拍板就行。