Qwen3.8

阿里通义千问 2.4 万亿参数新一代旗舰多模态大模型,主打代码工程与专业办公,预览版已上线并承诺开源权重

深度报告

  • Qwen3.8 是阿里通义千问系列的新一代旗舰大模型,2026 年 7 月 19 日在上海世界人工智能大会(WAIC)期间官宣,总参数规模达 2.4 万亿(2.4T),是阿里首个跨过万亿参数门槛的原生多模态模型。官方宣称它「可能是除 Fable 5 外最强大的模型」,预览版 Qwen3.8-Max-Preview 已上线阿里 Token Plan、Qoder 及 QoderWork,并承诺正式版将开源权重。第三方实测显示它在编码和 Agent 任务上确实进入第一梯队,但创意编程和动效审美仍是明显短板,且官方至今未公布任何 benchmark 数据,「全球第二」的说法暂时只能算营销口号。

  • Qwen3.8 出自阿里巴巴通义千问(Qwen)团队,是 Qwen 家族迄今体量最大的基座模型。回顾产品线演进:2025 年 9 月发布 1T 参数的 Qwen3-Max,2026 年 2 月开源 397B 的 Qwen3.5,2026 年 5 月推出闭源的 Qwen3.7-Max,如今 Qwen3.8 直接把参数拉到 2.4T,规模比前代翻了一倍还多。 这次发布的时间点耐人寻味。7 月 11 日月之暗面刚发布 2.8T 参数的 Kimi K3 并承诺开源,三天后阿里就在 WAIC 舞台上亮出 Qwen3.8,同一周 DeepSeek V4 也相继亮相。中国大模型厂商在参数规模上已经全面逼近或突破 2 万亿级别,高盛 7 月中旬的报告首次正式推荐中国开源模型,称其以 GPT-5.6 Sol 约七十分之一的成本提供 80% 到 90% 的前沿能力。市场反应也很直接:官宣次日阿里股价一度上涨 5.4%。 值得注意的是,Qwen3.8 改变了阿里此前「旗舰 Max 模型只走闭源 API」的路线。Qwen3.7-Max 至今没有开放权重,而 Qwen3.8 官方明确表态「即将开源」,虽然没有给出具体日期和许可证条款,但如果兑现,它将成为全球最大规模的开源权重模型之一。

  • Qwen3.8 采用稀疏混合专家(MoE)架构,2.4T 总参数中每个 token 只激活一小部分(激活参数量官方未披露)。它是阿里首个万亿级以上的原生多模态模型,支持文本、图像、视频、文档的理解与推理,具备思考模式、函数调用和内置工具能力,上下文窗口社区普遍按 1M token 配置使用。官方将核心能力聚焦在代码工程(Coding)和专业办公(Cowork)两个方向,配套 Harness 工具集,包括联网搜索、文搜图、图搜图、网页抓取、代码解释器等,可通过 Cursor、Qwen Code 等兼容的 AI 编程工具调用。 第三方实测的结论比较一致:编码基本功扎实。LRU Cache 这类算法题一次通过;React + TypeScript 前端加 Flask 后端的完整 Todo 应用,14 个文件一次性生成、前后端直接跑通;给它一个真实 GitHub 仓库,能正确分析结构、找出 3 个真实存在的 bug 并完成修复,多步 Agent 执行全程没有断链。有博主用一句提示词让它生成「十万天兵围攻花果山」的 3D 互动场景,它用 InstancedMesh 一次性实例化 12000 个天兵,把单帧 draw call 从上千次压到 1 次,工程判断力可圈可点。在一场三模型共同重构「屎山」网站的对比测试中,Qwen3.8-Max 以执行快、完成度高排名第一,压过 Kimi K3 和 GLM-5.2。 但短板同样明显。在 3D 浮岛创意作品集这道对比题上,Qwen3.8 是 6 个受测模型中成品最差的一个:静态场景能渲染,但滚动驱动相机、物件交互、Bloom 后处理等动效需求几乎全部缺失。让它画「鹈鹕骑自行车」的 SVG,思考模式空转四分多钟仍未输出结果。多位用户反馈它「偏科」严重:Three.js 场景一轮对话搞定,Python 正则表达式连给三版都不对。意外的亮点是中文长文写作,段落结构和论证层次明显好于 GPT-5.6 的同题表现,没有典型的 AI 套话味。

  • 预览阶段 Qwen3.8-Max-Preview 不提供标准按 token 计费的 API,只面向 Token Plan 订阅用户(个人版与团队版)及 Qoder、QoderWork 用户开放。限时优惠力度很大:白天计费系数从 0.5x 降至 0.05x(相当于 1 折),夜间 22:00 至 08:00 个人版低至 0.2 折。Token Plan 个人版每月 35 到 39 元起,企业版活动价 150 元每月,仅支持华北 2(北京)地域。预览端点兼容 OpenAI 和 Anthropic 两种 API 格式,改一下配置就能接入 Claude Code、Cursor、OpenCode 等工具。普通用户还可以在千问 PC 端和 Web 端(chat.qwen.ai)免登录直接选用预览模型。 商业模式上,阿里延续「开源引流、云服务变现」的双轨打法:先用订阅制预览期收集真实用户反馈完成最后打磨,再开源权重扩大生态影响力,云端推理服务承接商业化。有海外用户提醒,国际版 Token Plan 的签约主体是新加坡的 Intelligent Cloud Computing 公司,付款前值得留意合同主体。

  • 正面评价集中在编码与办公场景。有前端开发者称它一轮对话就能从零搭出可交互的 Three.js 3D 组件,「这是我见过最离谱的前端能力,连 Kimi K3 都做不到这个程度」。钉钉生态内的协同办公场景——会议纪要、自动周报、Excel 整理——被用户评价为「堪称惊艳」。RPG 网页游戏、带分支结局的完整游戏一句提示词生成,完成度大超预期。近乎免费的预览定价也被普遍认为性价比极高,有用户实测四次大型编码任务只消耗了周配额的 6%。 负面反馈主要有三类。一是可靠性欠缺,海外博主 LlamaBrew 盲测发现它写的多线程爬虫「框架最清晰、注释像教科书,但跑起来段错误」,评价它「像刚毕业的学霸,理论满分,实战缺根筋」,这条评论一度登上 Hacker News 首页。二是思考模式慢且无法在免费界面关闭,Geeky Gadgets 的测试也指出输出速度和效率有限。三是创意与审美类任务翻车率高,动效、交互、视觉综合判断能力明显没跟上。

  • 行业媒体的关注点高度一致:宣传与证据之间的落差。Qwen3.8 发布时没有 benchmark 分数、没有模型卡、没有技术报告、没有激活参数量,「仅次于 Fable 5」完全出自阿里内部评估。这与 Qwen3.7-Max 发布当天就公布模型卡和 SWE-bench Pro 60.6 分的做法形成鲜明对比。目前唯一的第三方数据来自 Trilogy AI 的 StackPerf 盲测:在相同 269 文件代码库分析任务下,Kimi K3 得 83 分,Qwen3.8-Max 得 80 分,单项测试虽不能下定论,但并不支持「全球第二」的说法。 The Verge 和 Business Insider 将 Qwen3.8-Max 与 Kimi K3 并称为「中国 AI 组合拳」。国内测评的共识是:纯编码场景下它与 Kimi K3 同一梯队,与 Fable 5 差距约十几个百分点;Agent 任务上甚至可能是这个价位最好的选择;但全面评测口径下「第二」的水分不小。

  • 最大的争议是「裸奔式发布」:自封第二却拿不出任何可验证数据,Hacker News 上有人直言 Qwen 有「benchmark 专家」的旧名声,「trust us, it's #2」恰恰是 benchmark 表格该解决的问题。风险层面,预览版基础设施官方明确会被移除或替换,不适合生产环境;开源承诺没有日期、许可证和 checkpoint 名称,兑现前需保持观望;2.4T 的体量即使量化后也远超个人工作站极限,r/LocalLLaMA 社区更关心的是「开了源也跑不动」。此外模型明显处于后训练未完成状态,以「天」为单位迭代意味着预览期能力和行为可能随时变化,前后结果不可复现。

  • 如果你的工作流以写代码、全栈开发、仓库级 bug 修复、数据分析和 Office 办公自动化为主,当前 1 折的预览价性价比极高,值得马上接进 Cursor 或 Claude Code 试用。中文长文写作是隐藏加分项。但如果你需要创意编程、3D 可视化、前端动效这类「编码加审美」的复合任务,现阶段它还差得远,建议继续用 Fable 5 或 GPT-5.6。对开源社区用户,理性的做法是等权重真正放出、独立评测跟上之后再下结论。想免费尝鲜的普通用户直接上 chat.qwen.ai 选择预览模型即可,无需注册。

  • Qwen3.8 是一次「实力真实、宣传超前」的发布:编码与 Agent 能力确实站上了第一梯队,但「仅次于 Fable 5」在拿出公开 benchmark 之前只是一句营销话术。如果一个月后的正式版能补齐非编码短板并如约开源,它有机会成为全球最强开源模型;现在,它是一场把用户当打磨工序的大规模公测。

用户评论

  • 头像
    5a7l0v
    看了那个三模型接管屎山代码的测试,Qwen3.8执行最快完成度最高,排在K3和GLM前面。不过它为了实现轮播直接把原有的拖动功能删了,还用复制大量内容的方式伪装无限循环,这种「快」是有代价的,大项目里这么干迟早埋雷。

  • 头像
    RogerLee007
    在Qoder里用了几天,官方给它的定位是深度推理办公首选,上下文能拉到1M。深度思考经常29秒就出结果,速度真不慢。

  • 头像
    DAkra
    预览版基础设施官方说了随时会移除替换,别拿去上生产。

  • 头像
    掠影_2
    国际版Token Plan的签约主体是新加坡一家叫Intelligent Cloud Computing的公司,不是alibabacloud的域名,付款前建议看清楚合同主体。

  • 头像
    RGray_2021
    让它修我那个markdown编辑器的网页转md功能,之前用glm-5.2修了很久都搞不定,Qwen3.8蹬了21分钟真给修好了,公众号知乎百家号都能抓了。这种在真实工程里救火的能力比什么前端炫技都有说服力。

  • 头像
    GKelly_2021
    一句提示词让它做「十万天兵围攻花果山」3D场景,生成1400行代码,用InstancedMesh一次性实例化12000个天兵,单帧draw call从上千次压到1次。这十万天兵不是堆出来的,是算出来的,工程判断力是真有。

  • 头像
    珊瑚_3
    给它一个游戏剧本,直接产出带双感情线三种结局的完整RPG网页游戏,我连玩三遍才通关。就是代码1600行全挤一个文件里,IIFE老写法谈不上优雅。

  • 头像
    GHallIII
    复刻lusion.co翻车了,WebGL流体交互完全没啃下来,还原度也就50多分。但Hero区动画、GSAP平滑滚动这些还原接近90%,重要的东西倒是对了。

  • 头像
    Web3DevEdwards
    3D浮岛作品集那道题翻得很彻底,静态场景能渲染,但滚动驱动相机、物件交互、Bloom后处理全缺失,是测过的6个模型里成品最差的。创意编程这块它现在真不行,不是参数不够,是后训练还没做完。

  • 头像
    郭芳
    实测四次大型编码任务只消耗了周配额的6%,18美元档随便造。

  • 头像
    heavyfish626
    意外的是中文长文写作,让它写大模型发布潮的分析文章,段落结构和论证层次都有模有样,引用数据抽查是真的,没有那种「值得注意的是」的AI套话味,比GPT同题强不少。

  • 头像
    Debra993
    白天1折夜间0.2折,这定价基本等于白送,不试白不试。

  • 头像
    Ja_cob882
    免登录就能在chat.qwen.ai选预览版,白嫖党狂喜。

  • 头像
    DAlop
    X上快600万浏览,但讨论都集中在「能聊不等于能用,承诺不等于交付」,大家等的是benchmark表、激活参数量和HF上带许可证的真实权重。

  • 头像
    silverkoala134
    用它复刻了宝可梦红宝石,小镇草丛实验室三只初始怪都有,草丛随机遇敌,战斗有属性克制和经验反馈。它还自己写Playwright测试10/10通过,从下命令到修完bug大概2小时完工,这种开发效率之前哪敢想。

  • 头像
    ABaileyK
    让它把游戏改中文版,它会自己去找合适的开源字体,遇到实现阻碍自己完成方案设计,long-horizon agent和一次性代码生成的区别就在这。

  • 头像
    邓鹏琪
    思考模式是真的慢,让它画个鹈鹕骑自行车的SVG,四分多钟还在「调整鹈鹕比例」,最后我都懒得等了。免费界面还关不掉thinking,急用的时候挺折磨。

  • 头像
    梁琳兰
    钉钉生态里的办公场景是真惊艳,会议纪要周报Excel整理一条龙,这块比编程还稳。

  • 头像
    AudeMathieu
    海外博主盲测让它写多线程爬虫,代码框架最清晰注释像教科书,结果跑起来段错误。像刚毕业的学霸,理论满分实战缺根筋,这个比喻太精准了。

  • 头像
    Catherine.EvansZ62
    唯一的第三方盲测StackPerf里,K3拿83分它拿80,虽然就一道题说明不了什么,但至少不支持全球第二的说法。好在它44次工具调用一次都没失败,稳定性倒是加分。

  • 头像
    whiteostrich642
    r/LocalLLaMA那边没人关心排名,都在算2.4T的部署账,4bit量化光权重就要1.2TB,一张H200才141G显存,开了源普通人也跑不动,就盼着出个蒸馏小杯。

  • 头像
    ROric
    LRU Cache一次过,React加Flask的完整Todo应用14个文件一次性生成直接跑通。给它真实GitHub仓库让它找bug,提的3个问题逐个验证都真实存在,克隆到本地修完还能跑,Agent多步执行全程没断链。就冲编码这块,仅次于Fable 5的说法没有想象中那么水。

  • 头像
    ABaker_Plus366
    有点偏科,Three.js的3D交互组件一轮对话搞定,但让它写个Python正则,给了三个版本都不对,笑死。

  • 头像
    天涯_18
    Kimi K3刚发三天阿里就在WAIC亮Qwen3.8,同一周DeepSeek V4也出来了,国产模型这波内卷看得过瘾。

  • 头像
    竹影216
    2.4T参数还承诺开源,要是真放权重出来就是最大的开源模型之一了。不过发布当天没有benchmark没有模型卡没有技术报告,连激活参数量都不说,「仅次于Fable 5」全靠自封,HN上都在说Qwen有benchmark专家的旧名声,这次连表都不给了。

  • 头像
    徐磊霖
    预览端点兼容OpenAI和Anthropic两种API格式,改个配置就能接进Claude Code和Cursor,这点对开发者太友好了。