磐石·科学基础大模型2.0
中国科学院打造的通专一体科学专用大模型,为科研提供高可信、可解释的智能底座
深度报告
-
磐石·科学基础大模型2.0(英文名 ScienceOne Omni)是中国科学院组织多个研究所联合打造的科学专用大模型,2026年7月17日在世界人工智能大会上正式发布。它不是又一个通用聊天模型,而是服务于科学研究任务的智能底座,主打「通专一体」——把通用理解能力和各学科专业能力放在同一个模型里联合训练。官方称在60余项专业科研任务评测中,磐石2.0在绝大多数任务上显著超越 Gemini-3.1-pro、GPT-5.5 等通用旗舰模型,并在化学性质预测、谱到分子结构预测、蛋白质位点预测等任务上达到国际最佳。模型已全面开源,可通过官网 scienceone.ia.ac.cn 访问使用。
-
磐石由中国科学院牵头,统筹跨学科资源联合打造,中国科学院自动化研究所是技术攻关的牵头单位,磐石团队负责人是自动化所副所长曾大军。这不是单个实验室的项目,而是一次建制化的集体攻关:数学与系统科学研究院、高能物理研究所、力学研究所、地理科学与资源研究所、青藏高原研究所、动物研究所、国家天文台、上海硅酸盐研究所、中国科学院大学、香港创新研究院等单位各自承担领域垂直模型和专业智能体的构建,产业化平台中科闻歌主攻基础大模型训练,中科紫东太初负责工具底座与智能体工厂,华为、海光、思朗科技等企业提供算力支持。 从时间线看,磐石的迭代很密集。1.0 版本在2025年7月26日的世界人工智能大会首发,当时就已全面开源,定位是「AI+科学」操作系统。同年12月发布 V1.5,强化多模态推理,新增创新评估、智能体工厂等能力。2026年4月28日推出「磐石100」模型体系,搭建波、谱、场三大科学模态基座,建成8大学科领域专用模型集群,覆盖超100个科研场景。2026年7月17日的2.0,是这一年密集迭代后的全面升级。截至2.0发布,初代产品已服务超过3万名科研工作者。
-
磐石2.0的核心是一套递进的三层架构,官方把它概括为「科学数据统一编码—自然世界知识对齐—领域任务定向解码」的完整科学智能链路。通俗说,就是先把波、谱、场等各种科学模态数据统一「读懂」,再和自然世界的知识对齐,最后针对具体领域任务给出解答。一个模型就能完成跨学科数据理解、知识推理、科学预测、专业内容生成等多种任务,试图同时破解两个老问题:传统领域模型学科壁垒高、通用模型专业科学能力不足。 数据是它的底气所在。中国科学院科技语料库联合各研究所构建了800万条高质量科学推理数据,覆盖200多个科研任务。磐石团队把科学家的思维方式转化成推理准则,构建可验证的推理链路,让模型学会基于知识链和证据链来推理,官方把这套效果概括为「高可信、强逻辑、可解释」——对科研场景来说,能追溯证据比答得漂亮更重要。 围绕模型,磐石建成了一体化智能科研平台,贯通「数据基盘—工具底座—智能体枢纽—异构算力」。平台汇聚了8000余个专业科研工具和技能库,科研人员可以按需定制专用模型和智能体。几个招牌智能体已经规模化落地:文献罗盘智能体能在3小时内生成专业水平综述,证据归因准确率90%,累计已生成近4万篇综述,接入了1.7亿篇科技文献,把过去要3到5天的文献调研压缩到20分钟;创新评价智能体负责识别关键问题、研判方向;智能体工厂支持用自然语言自动匹配、调度科研工具,把复杂科研流程串起来一体化执行。 算力上,磐石2.0搭了「超算+智算+速算」三位一体的异构体系。超算跑通用科学计算和高通量仿真,智算集群保障训练和推理,速算依托思朗科技「天穹」等专用科学计算硬件,专门极速完成分子动力学、量子化学等高精度长时程模拟。整套算力已经适配昇腾、海光等国产芯片,官方强调这是「自主可控」的科学计算新基座。
-
磐石走的是开源开放路线,模型已全面开源,官网 scienceone.ia.ac.cn 可直接访问使用,这一点和商业闭源模型有本质区别。它的商业逻辑不是靠 API 订阅赚钱,而是作为国家级科研基础设施,通过科学领域国家人工智能应用基地、中国科学院A类先导专项、北京市科技计划创新专项等项目支撑,目标是服务科研共同体、构建「AI+科学」生态。目标用户非常明确:一线科研人员、科研院所、高校和相关企业,而不是普通消费者。
-
从落地规模看,磐石获得了科研圈的实际认可。初代已服务超3万名科研工作者,2.0落地50余家中国科学院内研究所、30余家院外高校科研单位和央国企,并通过联合国教科文组织和「一带一路」国际科学组织联盟走向世界。自动化所工程师王汀提到,第二次青藏科考队的科学家曾拿一个专业问题考磐石,对比其他通用模型,磐石给出的答案更精准严谨,反复核对后与实际科考情况高度吻合,得到了科考专家的肯定。 具体场景的反馈也比较扎实。力学领域,团队基于磐石开发的流体高通量计算软件,把流体仿真从「网格生成、迭代求解、长周期验证」推向「无网格、秒级响应」,10秒内出结果、误差控制在5%以内。天文领域,天文光谱智能体让稀有天体识别准确率相比现有最优方法提升约50%,已部署到国家天文台,服务郭守敬望远镜。化学领域,磐石驱动中国科学技术大学的机器科学家系统,实现材料按需创制闭环,已完成462组样品合成表征和千万级虚拟筛选,前20候选材料中有8个性能优于原有最优样品,系统稳定运行超1500小时。
-
行业普遍把磐石看作中国在「AI for Science」方向上的一次重要突破。它填补的是一个真实空白:通用大模型再强,在专业科研任务上的可靠性、可解释性往往不够;而传统领域专用模型又各自为政、难以跨学科协同。磐石的「通专一体」和统一科研平台,被视为给「人工智能+科学」提供了一个跨学科的「操作系统」。发布会上多位科学家的表态也呼应了这个趋势——物理智能要把AI从科学的「读者」变成知识的「创造者」,行业重心从「演示多惊艳」转向「运行多可靠」。 值得注意的是,磐石并非孤例,而是中国科学智能生态的一部分。同期还有以 DPA 大原子模型为代表的专用计算模型(DPA4 在材料发现国际榜单上位列第一),以及汇聚超2亿篇文献、5万余个科研工具的「玻尔科研空间站」平台。这些资源正在被统筹整合,形成一个更完整的科研智能生态。
-
需要冷静看待的是官方数据的语境。「60余项评测显著超越 Gemini-3.1-pro、GPT-5.5」这类结论来自研发方自评和发布会口径,评测集的选择、任务范围都偏向科学专业任务,不能简单等同于综合智能的全面领先——在通用对话、日常任务上,磐石并不以此见长,它本来也不是为这些场景设计的。第三方独立复现和横向评测目前还比较有限。 其次,磐石的价值高度依赖生态和配套。它的很多亮点(文献罗盘、流体软件、机器科学家系统)本质是「模型+平台+专用硬件+领域数据」的组合拳,脱离中国科学院的建制化资源、国产算力和海量科学语料,普通团队很难复制同样的效果。对院外一般研究者来说,能用到的深度可能和院内单位有差距。 第三,它高度绑定国产算力和自主可控路线,这是战略优势,但也意味着它的定位更偏向国家科研基础设施,而非全球开发者随手可用的通用工具。开源虽降低了门槛,但真正把它跑出效果,仍需要相当的科学背景和算力条件。
-
磐石2.0最适合的是有明确科研任务的人群:科研院所和高校的研究人员、需要做文献综述和跨学科数据分析的团队、从事材料/化学/天文/力学/生命科学等领域计算与仿真的科学家。对他们来说,文献罗盘、工具调度、专用领域模型是实打实能提效的工具,尤其是文献调研从几天缩到20分钟这类场景。 不适合的是找通用聊天助手、日常办公或内容创作的普通用户——磐石不是干这个的,用它来写文案、聊天并不划算。想尝试的科研人员可以直接从官网 scienceone.ia.ac.cn 入手,先用文献罗盘和工具调度台这类门槛较低的智能体上手,再按学科需求接入对应的专用模型。若你的领域正好在磐石重点覆盖的数理化天地生范围内,收益会更明显。
-
磐石·科学基础大模型2.0是中国「AI for Science」路线上一次有分量的集体攻关,它的真正价值不在于跑分超过某个通用模型,而在于用「通专一体」的模型加一体化科研平台,为科学研究搭起了一套可追溯、可协同、自主可控的智能底座。它的天花板取决于生态能铺多广、院外能用多深,但方向清晰、落地扎实,值得科研圈持续关注。
用户评论
-
rONALD181—中科闻歌主攻训练,紫东太初做工具底座,几十家研究所高校企业一起上,这种跨体制的创新联合体模式在国内AI圈还挺少见的。 -
SatsChasera76—已经落地50多家院内所30多家院外单位,还通过教科文组织走出去了,生态铺得比我想的快。 -
MariaFrank—文献罗盘是真的省事,以前做个综述光前期查文献起码耗一周,还得自己一篇篇读一篇篇记,现在两三个小时就能出一版图文表都有的初稿,重点是它还会把每篇文献的核心创新点标出来、给出证据归因,改改就能直接用,对我们这种天天泡文献的博士生来说属于是解放生产力了。 -
Gerald_Bailey—看到宣传说60余项评测超过Gemini-3.1-pro和GPT-5.5,先冷静一下,这是发布方自评的科学专业任务榜,日常对话写东西它不一定比得过通用模型,别拿来当ChatGPT用。 -
DianaBarnes_2021—作为在读博士,最实用的其实是工具调度台,8000多个科研工具没人能全熟练用,让智能体自动编排工具链这个思路帮我省了太多学习成本。 -
Amber.PerryX—全面开源这点必须点赞,官网scienceone.ia.ac.cn直接就能上手,不用申请不用付费,国家队做基础设施就得是这个格局。 -
KathleenRichardson_2020500—超算智算速算三位一体这个配置有点东西,尤其速算靠天穹专用硬件跑分子动力学,这种长时程高精度仿真普通GPU真顶不住。 -
f5kkfztwnkr—我们组搞材料的,之前看中科院技能大赛里上海硅酸盐所那个吸波材料工具链,输入性能需求模型自己调工具推参数,30分钟顶过去几个月,看得我直接破防。 -
AnnaTurner_X5—希望后续院外的开放程度能再大点,现在感觉院内单位能用到的深度和我们这种外面的还是有差距的,别搞成只是名义上开源。 -
John.Mitchell_2024—高铁气动载荷那个案例,传统仿真几小时压到秒级,关键参数误差还降了42%,力学所是真下了功夫,工程落地价值比刷榜实在多了。 -
Edward_Barnes_66—泼点冷水,第三方独立评测目前太少了,官方口径再漂亮也得等更多外部复现,AI+科学最怕的就是演示很惊艳实际很拉胯。 -
ik42a_s—通专一体这个思路我是真认可的,通用模型专业性不够、动不动就一本正经胡说,领域模型又各管一摊互相不通气,磐石想用一个模型把跨学科的数据理解和推理都串起来,方向绝对是对的,但说实话能不能真做到还得看院外普通课题组实际用起来能到多深,别到时候变成院内单位专属。 -
任然—问一下有没有搞天文的用过那个光谱智能体,稀有天体识别准确率提升50%这个数听着有点猛,实际部署到郭守敬望远镜上体验咋样? -
Jack_Hill_7—化学那个机器科学家案例是真正的科研闭环,科研人员只要输入创制需求,智能体就自己拆解任务、调度文献挖掘实验设计机器操作计算模拟智算优化五个智能体协同跑,现在已经完成462组样品合成表征和千万级虚拟筛选,前20候选材料里有8个性能超过原来的最优样品,还稳定运行了1500多小时,这才叫AI做科研。 -
MsBrookeThomas_88—800万条科学推理数据覆盖200多个任务,据说明年要扩到800个任务,这数据工程量真不是一般团队能扛的,建制化优势体现得淋漓尽致。 -
JeremyHcward—说句可能不讨喜的话,磐石的很多亮点本质是模型加平台加专用硬件加海量领域数据的组合拳,文献罗盘也好流体软件也好机器科学家也好,都离不开中科院这套建制化资源和国产算力,脱离了这个体系普通团队想复现同样效果基本没戏,所以开源归开源,能不能跑出这效果是另一回事。 -
Christopher_Scott_2020—从1.0到V1.5再到磐石100,一年迭代这么密,中科院这波AI+科学是真上心了。 -
o0mb6sz1—磐石2.0英文名ScienceOne Omni起得挺有野心,一个模型通吃数理化天地生,就看这条通专一体的路能走多远了。 -
DBarnes_X—它不是给普通人聊天用的,别拿它写文案,人家定位就是科研底座,用错场景纯属浪费。 -
EthanHall—谱到分子结构预测能领先领域专用模型这点挺意外的,一般以为通专一体会两头不讨好,结果专业任务上真打过了AlphaFold那类专用模型。 -
DorisStewart_2020—青藏科考那个例子印象很深,第二次科考队的科学家专门拿一个青藏专业问题去考它,对比其他通用模型,磐石给的答案更精准更严谨,反复核对之后居然和实际科考情况高度吻合,最后连科考专家都点头认可,这种垂直领域的严谨程度真的是通用大模型给不了的。 -
vzl36ilns—证据归因准确率90%这点对科研太重要了,通用模型一本正经胡说的毛病谁受得了,能追溯证据链才敢放心用在正经研究里。 -
RachelHoward—三层架构那套科学数据统一编码到领域定向解码的说法听着挺唬人,说白了就是先读懂波谱场这些科学数据再对齐知识最后出答案,能落地就是好架构。 -
GHallIII—徐楠那句数据第一架构第二算力第三我太赞同了,科学模态数据不像互联网上的论文新闻随便爬,蛋白质三维结构、晶体结构这些高价值数据得靠长期实验测量才能拿到,还分散在各个数据库和团队手里,得领域专家做质控标注才能用来训练,不是把论文专利下载下来就能训科学基础模型的,这才是真正的瓶颈。 -
SharonCooper_X130—免费开源加国产算力适配昇腾海光,自主可控这四个字在当下的分量不用多说了。