Qwen3.8

阿里通義千問 2.4 萬億引數新一代旗艦多模態大模型,主打程式碼工程與專業辦公,預覽版已上線並承諾開源權重

深度報告

  • Qwen3.8 是阿里通義千問系列的新一代旗艦大模型,2026 年 7 月 19 日在上海世界人工智慧大會(WAIC)期間官宣,總引數規模達 2.4 萬億(2.4T),是阿里首個跨過萬億引數門檻的原生多模態模型。官方宣稱它「可能是除 Fable 5 外最強大的模型」,預覽版 Qwen3.8-Max-Preview 已上線阿里 Token Plan、Qoder 及 QoderWork,並承諾正式版將開源權重。第三方實測顯示它在編碼和 Agent 任務上確實進入第一梯隊,但創意程式設計和動效審美仍是明顯短板,且官方至今未公佈任何 benchmark 資料,「全球第二」的說法暫時只能算營銷口號。

  • Qwen3.8 出自阿里巴巴通義千問(Qwen)團隊,是 Qwen 家族迄今體量最大的基座模型。回顧產品線演進:2025 年 9 月釋出 1T 引數的 Qwen3-Max,2026 年 2 月開源 397B 的 Qwen3.5,2026 年 5 月推出閉源的 Qwen3.7-Max,如今 Qwen3.8 直接把引數拉到 2.4T,規模比前代翻了一倍還多。 這次釋出的時間點耐人尋味。7 月 11 日月之暗面剛釋出 2.8T 引數的 Kimi K3 並承諾開源,三天後阿里就在 WAIC 舞臺上亮出 Qwen3.8,同一周 DeepSeek V4 也相繼亮相。中國大模型廠商在引數規模上已經全面逼近或突破 2 萬億級別,高盛 7 月中旬的報告首次正式推薦中國開源模型,稱其以 GPT-5.6 Sol 約七十分之一的成本提供 80% 到 90% 的前沿能力。市場反應也很直接:官宣次日阿里股價一度上漲 5.4%。 值得注意的是,Qwen3.8 改變了阿里此前「旗艦 Max 模型只走閉源 API」的路線。Qwen3.7-Max 至今沒有開放權重,而 Qwen3.8 官方明確表態「即將開源」,雖然沒有給出具體日期和許可證條款,但如果兌現,它將成為全球最大規模的開源權重模型之一。

  • Qwen3.8 採用稀疏混合專家(MoE)架構,2.4T 總引數中每個 token 只啟用一小部分(啟用引數量官方未披露)。它是阿里首個萬億級以上的原生多模態模型,支援文字、影象、影片、文件的理解與推理,具備思考模式、函式呼叫和內建工具能力,上下文視窗社群普遍按 1M token 配置使用。官方將核心能力聚焦在程式碼工程(Coding)和專業辦公(Cowork)兩個方向,配套 Harness 工具集,包括聯網搜尋、文搜圖、圖搜圖、網頁抓取、程式碼直譯器等,可透過 Cursor、Qwen Code 等相容的 AI 程式設計工具呼叫。 第三方實測的結論比較一致:編碼基本功紮實。LRU Cache 這類演算法題一次透過;React + TypeScript 前端加 Flask 後端的完整 Todo 應用,14 個檔案一次性生成、前後端直接跑通;給它一個真實 GitHub 倉庫,能正確分析結構、找出 3 個真實存在的 bug 並完成修復,多步 Agent 執行全程沒有斷鏈。有博主用一句提示詞讓它生成「十萬天兵圍攻花果山」的 3D 互動場景,它用 InstancedMesh 一次性例項化 12000 個天兵,把單幀 draw call 從上千次壓到 1 次,工程判斷力可圈可點。在一場三模型共同重構「屎山」網站的對比測試中,Qwen3.8-Max 以執行快、完成度高排名第一,壓過 Kimi K3 和 GLM-5.2。 但短板同樣明顯。在 3D 浮島創意作品集這道對比題上,Qwen3.8 是 6 個受測模型中成品最差的一個:靜態場景能渲染,但滾動驅動相機、物件互動、Bloom 後處理等動效需求幾乎全部缺失。讓它畫「鵜鶘騎腳踏車」的 SVG,思考模式空轉四分多鐘仍未輸出結果。多位使用者反饋它「偏科」嚴重:Three.js 場景一輪對話搞定,Python 正規表示式連給三版都不對。意外的亮點是中文長文寫作,段落結構和論證層次明顯好於 GPT-5.6 的同題表現,沒有典型的 AI 套話味。

  • 預覽階段 Qwen3.8-Max-Preview 不提供標準按 token 計費的 API,只面向 Token Plan 訂閱使用者(個人版與團隊版)及 Qoder、QoderWork 使用者開放。限時優惠力度很大:白天計費係數從 0.5x 降至 0.05x(相當於 1 折),夜間 22:00 至 08:00 個人版低至 0.2 折。Token Plan 個人版每月 35 到 39 元起,企業版活動價 150 元每月,僅支援華北 2(北京)地域。預覽端點相容 OpenAI 和 Anthropic 兩種 API 格式,改一下配置就能接入 Claude Code、Cursor、OpenCode 等工具。普通使用者還可以在千問 PC 端和 Web 端(chat.qwen.ai)免登入直接選用預覽模型。 商業模式上,阿里延續「開源引流、雲服務變現」的雙軌打法:先用訂閱制預覽期收集真實使用者反饋完成最後打磨,再開源權重擴大生態影響力,雲端推理服務承接商業化。有海外使用者提醒,國際版 Token Plan 的簽約主體是新加坡的 Intelligent Cloud Computing 公司,付款前值得留意合同主體。

  • 正面評價集中在編碼與辦公場景。有前端開發者稱它一輪對話就能從零搭出可互動的 Three.js 3D 元件,「這是我見過最離譜的前端能力,連 Kimi K3 都做不到這個程度」。釘釘生態內的協同辦公場景——會議紀要、自動週報、Excel 整理——被使用者評價為「堪稱驚豔」。RPG 網頁遊戲、帶分支結局的完整遊戲一句提示詞生成,完成度大超預期。近乎免費的預覽定價也被普遍認為價效比極高,有使用者實測四次大型編碼任務只消耗了周配額的 6%。 負面反饋主要有三類。一是可靠性欠缺,海外博主 LlamaBrew 盲測發現它寫的多執行緒爬蟲「框架最清晰、註釋像教科書,但跑起來段錯誤」,評價它「像剛畢業的學霸,理論滿分,實戰缺根筋」,這條評論一度登上 Hacker News 首頁。二是思考模式慢且無法在免費介面關閉,Geeky Gadgets 的測試也指出輸出速度和效率有限。三是創意與審美類任務翻車率高,動效、互動、視覺綜合判斷能力明顯沒跟上。

  • 行業媒體的關注點高度一致:宣傳與證據之間的落差。Qwen3.8 釋出時沒有 benchmark 分數、沒有模型卡、沒有技術報告、沒有啟用引數量,「僅次於 Fable 5」完全出自阿里內部評估。這與 Qwen3.7-Max 釋出當天就公佈模型卡和 SWE-bench Pro 60.6 分的做法形成鮮明對比。目前唯一的第三方資料來自 Trilogy AI 的 StackPerf 盲測:在相同 269 檔案程式碼庫分析任務下,Kimi K3 得 83 分,Qwen3.8-Max 得 80 分,單項測試雖不能下定論,但並不支援「全球第二」的說法。 The Verge 和 Business Insider 將 Qwen3.8-Max 與 Kimi K3 並稱為「中國 AI 組合拳」。國內測評的共識是:純編碼場景下它與 Kimi K3 同一梯隊,與 Fable 5 差距約十幾個百分點;Agent 任務上甚至可能是這個價位最好的選擇;但全面評測口徑下「第二」的水分不小。

  • 最大的爭議是「裸奔式釋出」:自封第二卻拿不出任何可驗證資料,Hacker News 上有人直言 Qwen 有「benchmark 專家」的舊名聲,「trust us, it's #2」恰恰是 benchmark 表格該解決的問題。風險層面,預覽版基礎設施官方明確會被移除或替換,不適合生產環境;開源承諾沒有日期、許可證和 checkpoint 名稱,兌現前需保持觀望;2.4T 的體量即使量化後也遠超個人工作站極限,r/LocalLLaMA 社群更關心的是「開了源也跑不動」。此外模型明顯處於後訓練未完成狀態,以「天」為單位迭代意味著預覽期能力和行為可能隨時變化,前後結果不可復現。

  • 如果你的工作流以寫程式碼、全棧開發、倉庫級 bug 修復、資料分析和 Office 辦公自動化為主,當前 1 折的預覽價價效比極高,值得馬上接進 Cursor 或 Claude Code 試用。中文長文寫作是隱藏加分項。但如果你需要創意程式設計、3D 視覺化、前端動效這類「編碼加審美」的複合任務,現階段它還差得遠,建議繼續用 Fable 5 或 GPT-5.6。對開源社群使用者,理性的做法是等權重真正放出、獨立評測跟上之後再下結論。想免費嚐鮮的普通使用者直接上 chat.qwen.ai 選擇預覽模型即可,無需註冊。

  • Qwen3.8 是一次「實力真實、宣傳超前」的釋出:編碼與 Agent 能力確實站上了第一梯隊,但「僅次於 Fable 5」在拿出公開 benchmark 之前只是一句營銷話術。如果一個月後的正式版能補齊非編碼短板並如約開源,它有機會成為全球最強開源模型;現在,它是一場把使用者當打磨工序的大規模公測。

使用者評論

  • 頭像
    5a7l0v
    看了那個三模型接管屎山程式碼的測試,Qwen3.8執行最快完成度最高,排在K3和GLM前面。不過它為了實現輪播直接把原有的拖動功能刪了,還用複製大量內容的方式偽裝無限迴圈,這種「快」是有代價的,大專案裡這麼幹遲早埋雷。

  • 頭像
    RogerLee007
    在Qoder裡用了幾天,官方給它的定位是深度推理辦公首選,上下文能拉到1M。深度思考經常29秒就出結果,速度真不慢。

  • 頭像
    DAkra
    預覽版基礎設施官方說了隨時會移除替換,別拿去上生產。

  • 頭像
    掠影_2
    國際版Token Plan的簽約主體是新加坡一家叫Intelligent Cloud Computing的公司,不是alibabacloud的域名,付款前建議看清楚合同主體。

  • 頭像
    RGray_2021
    讓它修我那個markdown編輯器的網頁轉md功能,之前用glm-5.2修了很久都搞不定,Qwen3.8蹬了21分鐘真給修好了,公眾號知乎百家號都能抓了。這種在真實工程裡救火的能力比什麼前端炫技都有說服力。

  • 頭像
    GKelly_2021
    一句提示詞讓它做「十萬天兵圍攻花果山」3D場景,生成1400行程式碼,用InstancedMesh一次性例項化12000個天兵,單幀draw call從上千次壓到1次。這十萬天兵不是堆出來的,是算出來的,工程判斷力是真有。

  • 頭像
    珊瑚_3
    給它一個遊戲劇本,直接產出帶雙感情線三種結局的完整RPG網頁遊戲,我連玩三遍才通關。就是程式碼1600行全擠一個檔案裡,IIFE老寫法談不上優雅。

  • 頭像
    GHallIII
    復刻lusion.co翻車了,WebGL流體互動完全沒啃下來,還原度也就50多分。但Hero區動畫、GSAP平滑滾動這些還原接近90%,重要的東西倒是對了。

  • 頭像
    Web3DevEdwards
    3D浮島作品集那道題翻得很徹底,靜態場景能渲染,但滾動驅動相機、物件互動、Bloom後處理全缺失,是測過的6個模型裡成品最差的。創意程式設計這塊它現在真不行,不是引數不夠,是後訓練還沒做完。

  • 頭像
    郭芳
    實測四次大型編碼任務只消耗了周配額的6%,18美元檔隨便造。

  • 頭像
    heavyfish626
    意外的是中文長文寫作,讓它寫大模型釋出潮的分析文章,段落結構和論證層次都有模有樣,引用資料抽查是真的,沒有那種「值得注意的是」的AI套話味,比GPT同題強不少。

  • 頭像
    Debra993
    白天1折夜間0.2折,這定價基本等於白送,不試白不試。

  • 頭像
    Ja_cob882
    免登入就能在chat.qwen.ai選預覽版,白嫖黨狂喜。

  • 頭像
    DAlop
    X上快600萬瀏覽,但討論都集中在「能聊不等於能用,承諾不等於交付」,大家等的是benchmark表、啟用引數量和HF上帶許可證的真實權重。

  • 頭像
    silverkoala134
    用它復刻了寶可夢紅寶石,小鎮草叢實驗室三隻初始怪都有,草叢隨機遇敵,戰鬥有屬性剋制和經驗反饋。它還自己寫Playwright測試10/10透過,從下命令到修完bug大概2小時完工,這種開發效率之前哪敢想。

  • 頭像
    ABaileyK
    讓它把遊戲改中文版,它會自己去找合適的開源字型,遇到實現阻礙自己完成方案設計,long-horizon agent和一次性程式碼生成的區別就在這。

  • 頭像
    鄧鵬琪
    思考模式是真的慢,讓它畫個鵜鶘騎腳踏車的SVG,四分多鐘還在「調整鵜鶘比例」,最後我都懶得等了。免費介面還關不掉thinking,急用的時候挺折磨。

  • 頭像
    梁琳蘭
    釘釘生態裡的辦公場景是真驚豔,會議紀要週報Excel整理一條龍,這塊比程式設計還穩。

  • 頭像
    AudeMathieu
    海外博主盲測讓它寫多執行緒爬蟲,程式碼框架最清晰註釋像教科書,結果跑起來段錯誤。像剛畢業的學霸,理論滿分實戰缺根筋,這個比喻太精準了。

  • 頭像
    Catherine.EvansZ62
    唯一的第三方盲測StackPerf裡,K3拿83分它拿80,雖然就一道題說明不了什麼,但至少不支援全球第二的說法。好在它44次工具呼叫一次都沒失敗,穩定性倒是加分。

  • 頭像
    whiteostrich642
    r/LocalLLaMA那邊沒人關心排名,都在算2.4T的部署賬,4bit量化光權重就要1.2TB,一張H200才141G視訊記憶體,開了源普通人也跑不動,就盼著出個蒸餾小杯。

  • 頭像
    ROric
    LRU Cache一次過,React加Flask的完整Todo應用14個檔案一次性生成直接跑通。給它真實GitHub倉庫讓它找bug,提的3個問題逐個驗證都真實存在,克隆到本地修完還能跑,Agent多步執行全程沒斷鏈。就衝編碼這塊,僅次於Fable 5的說法沒有想象中那麼水。

  • 頭像
    ABaker_Plus366
    有點偏科,Three.js的3D互動元件一輪對話搞定,但讓它寫個Python正則,給了三個版本都不對,笑死。

  • 頭像
    天涯_18
    Kimi K3剛發三天阿里就在WAIC亮Qwen3.8,同一周DeepSeek V4也出來了,國產模型這波內卷看得過癮。

  • 頭像
    竹影216
    2.4T引數還承諾開源,要是真放權重出來就是最大的開源模型之一了。不過釋出當天沒有benchmark沒有模型卡沒有技術報告,連啟用引數量都不說,「僅次於Fable 5」全靠自封,HN上都在說Qwen有benchmark專家的舊名聲,這次連表都不給了。

  • 頭像
    徐磊霖
    預覽端點相容OpenAI和Anthropic兩種API格式,改個配置就能接進Claude Code和Cursor,這點對開發者太友好了。