科大讯飞 星火 6

科大讯飞基于全国产算力训练的认知大模型,语音与教育两大场景极强,政企落地领先,但通用对话与代码能力偏中下

深度报告

  • 「科大讯飞 星火 6」是产品速递里收录的一个条目,但需要先把一件事说清楚:截至 2026 年 7 月 18 日,科大讯飞官方并没有发布过名为「星火 6」或「星火 V6」的版本。官网与百度百科可查证的版本谱系是 V1.0→V1.5→V2.0→V3.0→V3.5→V4.0→V4.0 Turbo,之后转向深度推理大模型「星火 X1」及其升级版,以及 2026 年 6 月发布的原生多模态大模型「星火 X2-VL」。也就是说,官方命名体系里没有「6」这个代际。本报告以可核实的当前主力模型(星火 X1 升级版 + X2-VL 多模态 + 星火 4.0 Turbo 底座)为基准撰写,「星火 6」更可能是媒体或渠道对下一代的预期性称呼,最终命名与分类留给人工在后台审核确认。抛开名字,讯飞星火真正的底色是三点:全国产算力训练、语音与教育两大主场极强、政企落地订单国内领先;短板同样明确,通用对话、写作创意与代码能力在国产第一梯队里偏中下。

  • 科大讯飞成立于 1999 年,是国内智能语音领域的老牌龙头,2008 年就在国际语音合成大赛拿到接近真人的听感评分,后来把技术版图从语音识别、语音合成扩展到认知智能、通用大模型。星火大模型 2023 年 5 月 6 日正式发布 V1.0,此后保持高频迭代,是国内最早对标 ChatGPT 的一批国产大模型之一。 这家公司最鲜明的战略标签是「全栈自主可控」。它联合华为构建了基于昇腾生态的国产万卡算力平台「飞星一号」,2024 年又启动更大规模的「飞星二号」,2026 年进一步基于昇腾 950 推进全国产算力训练。董事长刘庆峰有句话被反复引用:「假如我们现在不是用国产平台,而是用已经成型的国外平台,今天星火大模型的效果可能会更好。但这一步你非走不可,除非你不想自立自强。」在美国持续收紧 AI 芯片出口的背景下,「用国产算力完成训练」而不仅仅是「在国产算力上跑推理」,成了讯飞区别于多数同行的护城河。经营层面也撑得住这套叙事:2025 年上半年公司整体营收 109.1 亿元,全年大模型相关招投标拿下 210 个项目、金额约 23.16 亿元,在国内通用大模型厂商里排第一,客户多为教育局、公立医院、能源国企这类政企主体。

  • 星火采用 MoE 混合专家架构,官网口径是推理效率提升 100%,主打七大核心能力:文本生成、语言理解、知识问答、逻辑推理、数学能力、代码能力、多模交互。围绕底座,产品线铺得很开。 面向个人的一侧,有星火 App、星火电脑版、SparkDesk 桌面版,2025 年 9 月升级后重点做「AI 写作、解题答疑、AI 阅读、深度研究」四件事,深度研究能把「搜资料到出 PPT」这条链路一次打通。语音是它的看家本领:多语种语音识别覆盖 37 个语种、130 多种语言能力,方言识别在国内几乎无对手;「小星畅聊」支持全语音、视觉、数字人多模交互,1.5 秒内响应、可随时打断、能感知情绪。多模态方面,2026 年 6 月发布的 X2-VL 是当前唯一基于全国产算力训练的主流多模态模型,看图、读文档、分析图表、理解画面样样能做,在高考模拟多模态试题里全学科准确率接近 95%。 面向企业的一侧,2026 年 6 月讯飞集中发布了四款企业级新品:星火营销助理(AI 营销数字员工,支持「1 名真人座席+5 个 AI 分身」协同)、星火 AI 企业风控官(风险体检、一键出风险报告,效率提升 5 到 8 倍)、星火智能语音 VoiceWise(高性能 CPU 版 ASR 免 GPU、全双工交互)、星火智能推理平台 SparkInfer(四级模型路由、语义缓存、Token 治理,综合可省 30% 到 60% Token)。生态落地相当密集,华为 Mate70 的通话摘要、比亚迪智能陪练、长虹 AI 电视、海康威视的 iFlyCode 代码助手、中石油昆仑大模型都用到了星火能力。 真实体验上口碑两极。数学、教育、语音这几个场景确实亮眼——2026 年高考多家媒体实测,星火在新高考 I 卷数学拿到 148/150 分位列第一,上海卷作文 65.5 分居首。但通用对话和写作是公认的弱项,多篇横评把它排在国产第一梯队末尾,代码能力更是被吐槽「写个排序都能出错」。

  • 个人端整体走「免费引流」路线,App 与网页版免费使用,写作类免费版每天约 5000 字额度。API 端是讯飞打价格战最狠的地方:2024 年 5 月宣布星火 Lite API「永久免费」,是业界首个把基础版本永久免费的公司;Pro/Max 版低至 0.21 元/万 tokens,按讯飞「1 token≈1.5 汉字」的口径,约 2.1 元就能生成一部《活着》体量的内容,价格约为当时百度文心 ERNIE-4.0、阿里通义 Qwen-Max 的五分之一。 商业逻辑很清楚:基础能力免费换流量和开发者规模,高价值的定制、私有化部署、行业微调收费。这套「漏斗式」打法在讯飞开放平台已被验证过,链接了超过 800 万开发者。真正赚钱的是政企整体解决方案——2026 年上半年,讯飞大模型收入里整套行业方案占比已超过六成,单笔合同金额持续走高,卖的不再是模型本身,而是「场景+能力+平台」的成套交付。

  • 正面评价高度集中在两块。一是语音,「语音转文字是王炸」「开会时口头禅都能自动过滤,准确率比手机自带高 30%」「方言区能听懂」,这是二十年积累换来的口碑。二是教育,专门的教育版能批改作文、辅导作业、生成练习题,老师和家长觉得实用;对话风格也被认为比 DeepSeek 的「学霸腔」更接近普通人说话。 负面反馈同样直白。多篇实测把星火的通用能力排在国产末位:「写东西逻辑乱成麻,让它写议论文论点能跑偏到姥姥家」「推荐 10 本书理由全是复制粘贴」「复杂任务容易崩,代码能力弱」「UI 太丑」。更扎心的是「存在感」问题,有锐评直接说「要不是写这篇文章,我都快忘了还有这号人物」「做 PPT 挺好,其他时候就是个摆设」。综合来看,用户的共识是:干语音和教育的活它是首选,让它做通用创作和写代码就是选错了工具。

  • 行业视角对讯飞的评价,比 C 端口碑要正面得多,因为看的是不同维度。媒体和分析机构普遍认可它「全国产算力底座+通用大模型能力+行业场景深耕」这条路线的确定性——中国日报称其为「最懂中国的全国产底座大模型」,逻辑是高考这种高度中国化、标准化、可评价的任务场景,恰好能检验模型是否真正理解中国语境和评价标准。技术侧,讯飞把长思维链强化学习训练效率从 30% 提升到 84%,MoE 全链路训练效率提升到 93%,这些工程数字指向的是「国产算力从能用走向好用」。 竞品格局里,讯飞的位置比较特殊。综合能力横评里它常排在 DeepSeek、通义千问、智谱、文心、豆包之后;但在「语音交互」这个细分维度,几乎所有横评都把它列为首选。这说明讯飞不是在通用榜单上跟人硬碰硬,而是靠语音、教育、政企这些差异化场景和自主可控叙事立足。

  • 第一个也是最需要标注的,是命名争议。「星火 6」并非官方已发布版本,当前可用的是星火 X1 升级版与 X2-VL 多模态,后台展示时需要人工确认是沿用「星火 6」这个名字、还是改为准确的官方型号,避免误导用户。 第二是通用能力的真实短板。剥离宣传话术,星火在通用对话、创意写作、代码这三块被反复证明偏弱,「一本正经胡说八道」的幻觉问题也被点名(尽管 X1 升级版宣称在幻觉治理上领先业界,实际体验仍有落差)。把它当全能选手用,大概率会失望。 第三是「高分」与「日常」的落差。高考数学 148 分、多模态 95% 这类成绩是标准化测试场景下的表现,和用户日常随手一问的体验并不完全对应——榜单强不等于手感好,这是所有靠 benchmark 叙事的模型都要面对的质疑。 第四是 C 端存在感和产品打磨。多位评测者提到星火 UI 审美、交互细节、更新节奏偏弱,「感觉像被遗弃的项目」虽属情绪化表达,但反映出讯飞的资源明显更偏向政企而非大众消费市场。

  • 适合的人很清晰:需要高精度语音转写、方言识别、会议记录、实时翻译的用户;教育工作者、学生和家长(作文批改、解题辅导、口语陪练);有自主可控、私有化部署、数据不出域硬性要求的政务、金融、能源、司法、医疗类政企客户;以及看重 API 性价比、想用永久免费 Lite 或低价 Pro/Max 做轻量集成的开发者。 不太适合的人也同样清晰:追求顶级通用对话、深度创意写作的重度内容创作者,代码为主的开发者,以及想要极致 C 端交互体验的普通用户——这几类需求,DeepSeek、通义千问在当前口碑里是更稳的选择。合理的用法是「场景化混搭」:语音和教育交给星火,通用问答和写代码交给别家。

  • 讯飞星火是一个「主场极强、通用偏弱」的选手:靠全国产算力训练、语音教育两大王牌和密集的政企落地站稳脚跟,但通用对话、写作、代码这些大众最常用的能力仍在第一梯队末尾。所谓「星火 6」目前更像是对下一代的期待而非官方现实,真正在跑的是 X1 升级版和 X2-VL。对政企和特定场景用户,它是有确定性的国产底座选择;对普通 C 端用户,它更像一件「专用工具」而非「全能助手」。

用户评论

  • 头像
    Jonathan_Perry_2021262
    语音转文字是真的王炸,开会开着它,老板那些嗯啊的口头禅都能自动过滤掉,准确率比手机自带的高一大截,这块讯飞做了二十年不是白做的。

  • 头像
    LarryMiller
    先说一句,官网压根没有什么星火6,最新的是X1升级版和那个X2-VL多模态,别被名字忽悠了。

  • 头像
    MarkHendersonSr511
    方言识别yyds。

  • 头像
    Susan_Phillips_7
    让它写议论文,论点能给你跑偏到姥姥家,逻辑乱成一团麻,写东西真别指望它。

  • 头像
    DeFiWav_e
    高考数学148分这个是真牛,新京报请了两位特级老师阅卷打的分,六款模型里第一,这推理能力放数学场景确实能打。

  • 头像
    Frances_PerezSr
    作为老师说句公道话,星火的教育版是真好用,批改作文、辅导作业、生成练习题一条龙,家里有娃的可以冲,比通用大模型贴合教学多了。

  • 头像
    grxxtvrd
    免费的谁不爱啊。

  • 头像
    Brian.Wood
    代码能力属实拉胯,让它写个排序都能给我整出bug,搞开发的还是老老实实用DeepSeek吧。

  • 头像
    浮生_8
    UI真的丑,个人审美接受无能。

  • 头像
    Henry_Evans_X
    永久免费的Lite API是真香,做个小项目集成完全够用,Pro/Max也才0.21一万token,比文心通义便宜太多了。

  • 头像
    FNX816758
    我一直觉得讯飞最被低估的点是全国产算力训练,不是拿国产卡跑推理那种,是从头训出来的。中美芯片这么卡的当口,能自己训才是真自主可控,这一步政企客户其实很看重。

  • 头像
    TerriLowe
    怎么说呢,存在感是真的低。

  • 头像
    heavypanda424
    X2-VL那个多模态还行,扔张带图表的试卷进去它能读懂,文档分析也可以,比之前图文分离强多了。

  • 头像
    MsMilleRasmussen_pro
    有没有人知道教育版单独怎么收费啊,看着功能不错但价格好像不便宜。

  • 头像
    MHughes_995
    综合能力横评里它基本垫底,DeepSeek通义智谱文心豆包排完才轮到它,但语音那一栏永远是它第一,这画风也是很割裂了。

  • 头像
    梁宇勇
    做PPT挺好,其他时候基本就是个摆设,我手机里装着但一个月打不开几次。

  • 头像
    EAbak
    口语化这点我给好评,比DeepSeek那种学霸腔听着舒服,更像正常人说话。

  • 头像
    Christine_Alvarez_2020
    实测一圈下来我的结论就是:语音和教育交给星火,通用问答和写代码交给别家,各干各擅长的活最省心,非要拿它当全能选手用的迟早失望,这不是一款让你惊艳的通用模型,但在它的主场几乎无对手。

  • 头像
    Bobby.HillX
    深度研究那个功能试了下,搜资料到出PPT一条龙,摸鱼党狂喜。

  • 头像
    RonaldDiaz168656
    幻觉还是有的,别看官方说X1升级版幻觉治理领先,实际用起来一本正经胡说八道的时候也不少,重要信息还是得自己核。

  • 头像
    杜燕
    讯飞2025年招投标拿了210个项目、23个多亿,国内通用大模型厂商里排第一,客户全是教育局医院能源国企。它根本没打算跟你在C端卷,人家闷声在政企赚钱,这商业模式其实很稳。

  • 头像
    Sarah_TurnerZ
    翻译耳机里用的就是它的技术,出国实测面对面翻译挺顺的,这种软硬一体的场景讯飞是真有积累。

  • 头像
    DPatelII
    医疗V3.5那个版本据说评测榜第一,能多人录音自动生成病历,这种垂类深耕才是讯飞的护城河吧。

  • 头像
    叶珍英
    栓Q,充了会员写作质量也没见涨多少。