近日,在上海举办的2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)上,AI for Science(AI4S,科学智能)成为最密集出现的词汇之一。多位受访专家判断,科学智能未来2-3年将进入产业化爆发期,而数据这个最基础也最稀缺的要素正在成为各方争夺的战略高地。
科学智能改写科研范式
AI4S对科研效率的重塑,正在改写多个行业的成本公式。
“设计高性能催化剂复杂又耗时,通过应用中国科学院发布的磐石·科学基础大模型2.0,催化剂设计时间从几个月缩短到30分钟,而且成功发现了一种活性提高38%的新型催化剂。”中国科学院自动化研究所研究员徐楠介绍,这种新材料已经具备产业价值。
“原来做一款药要花10年、投入10亿美元,而现在的目标是3个月、300万美元。”清华大学教授俞立说,AI正从辅助工具演变为科研基础设施的关键组成部分,其目标并非取代科学家,而是将科学家从重复劳动中解放出来,使之专注于科学洞察与创造性思考。
小米材料CORE团队负责人俞之奡也表示,AI对材料研发有很好的辅助作用,材料追求多维度均衡性能,传统方式很难同步兼顾全部指标,但AI可以统一优化性能、原材料成本、量产工艺、制造制程,快速筛选、收敛到高潜力研发方向,持续迭代优化材料配方。小米公司已通过项目验证了AI辅助材料研发的可行性。
越来越多的AI4S新成果让科研发现的周期正从“年”向“天”演进。
“悟界·Brainμ1.0”是全球首个生成理解统一的多模态神经科学大模型,它将脑电波、钙成像、脑磁等异构信号统一编码,使原本互不相通的神经信号能在同一框架下实现对齐与理解。据北京智源人工智能研究院研究员雷博介绍,由该模型支撑的研究首次证实,记忆可反向调控睡眠——正向记忆优化睡眠质量,负向记忆加剧睡眠碎片化,这为抑郁症、焦虑症等睡眠障碍的干预提供了全新思路。目前,这项研究已发表于《科学》期刊。
深圳河套学院联合苏州国家实验室推出的Owl·灵鉴(AuraID)多智能体系统,实现了从样品操作到数据解析的全流程自动化。目前,该系统已覆盖6类精密仪器,使得晶体结构解析的工作量减少50.6%,微观形貌分析耗时从9分钟缩短至7.5分钟,AI独立完成率从33%提升至80%。深圳河套学院副院长欧阳万里表示,科学表征需要大量专业知识和不同仪器协同,AI让设备互联互通、协同优化,把科学家从操作中解放出来,将精力投向科学洞察。
WAIC 2026的科学前沿论坛上,上海人工智能实验室发布了科学发现平台“书生·端砚”,这一平台面向真实科研任务,连接科学大模型、专业分析工具、实验数据与具身自动化设备,覆盖了从“假设提出”到“实验验证”的完整科研流程。
“未来2-3年,将是AI4S真正赋能产业的爆发期,很多新的材料、新的分子、新的药物会迸发出来。”徐楠判断。
数据瓶颈不容小觑
然而,在AI4S真正赋能产业、迎来爆发式增长的前夜,一个基础性问题浮出水面:数据。
谈及制约AI4S下一步发展的瓶颈时,徐楠直言,“第一是数据,第二是模型架构,第三是算力”。
科学数据与互联网数据有着本质区别。地震波、海洋洋流、大气影像、蛋白质结构、晶体数据——这些高度专业化的观测数据分散在不同机构、不同格式、不同标准中,且需要经过科学家的专业标注和加工,才能真正成为AI可学习的“科学语料”。
“高质量科学数据的生产,高度依赖科研专家。蛋白质结构、分子构效关系等关键知识,需要专家结合实验结果和领域经验进行解析与验证;材料性能等数据,也需要通过长期实验测试和计算模拟不断积累。因此,科学数据不同于互联网数据,其背后凝聚了大量专业知识和科研劳动。”徐楠解释说,“这些数据不仅记录了实验结果,更承载了科学规律和人类对自然的认知,我们称其为‘科学奥秘的数据’。”
在神经科学领域,数据稀缺的问题更为急迫。雷博透露,神经科学可用于模型训练的数据“可能不到目标数据的万分之三”。他还发现,数据已被看作是一种战略资源,“未来开源数据获取会越来越难,最重要的是要建我们自己的数据集,而且得系统地、有目标地建。”
面对这一瓶颈,各方正在提前卡位。北京智源人工智能研究院构建了BrainToken平台,统一预处理超过20个平台的开源神经科学数据。“只分享Token,让数据更容易被AI模型直接使用。”雷博说。
上海人工智能实验室则推出Sciverse科学智能数据库,提供大规模、高准确度、强时效性的AI Ready数据基座支持。
由中国科学院文献情报中心牵头建设的“敖仓·科技语料库”也在WAIC 2026期间正式发布。“敖仓·科技语料库”是通过精炼大量科学数据、科技论文、发明专利和科技图书,形成的让人工智能“读懂”的海量数据集合。除科研场景外,“敖仓·科技语料库”还针对商业航天、低空经济、智能制造、生物医药等领域开展语料加工服务,下一步,将支撑元器件选型、超微病理诊断、高速列车外形设计等百余个行业应用。
构筑坚实算力底座
作为人工智能基础设施,算力底座的布局同样至关重要。
华为是这场变局中不可忽视的力量。在WAIC 2026期间,华为科研军团总裁孙鹏飞表示:“AI正在改变世界,科研也不例外。在华为,我们相信真正的进步不仅在于技术突破,更在于负责任地用技术服务人类。”
“基于这个愿景,华为今年推出了两个方案:智算实验室解决方案回答‘智能底座从哪里来’,智慧科研解决方案回答‘如何更智能地做科研’。两者结合,让科学家从繁琐事务中解放出来,回归创新本身。”孙鹏飞说。
华为科研军团的智算实验室解决方案和智慧科研解决方案正在为越来越多的中国AI4S项目提供基础设施。书生系列大模型、磐石·科学基础大模型、悟界·Brainμ1.0多模态神经科学大模型、Owl·灵鉴多智能体系统等,都获得了包含昇腾算力、存储、网络等华为智算实验室和智慧科研行业解决方案的支持。
“我们与华为在AI算力优化方面开展了技术合作,显著提升了模型运行效率,完成了大量主流AI模型的适配工作,目前几乎所有模型都能在我们的系统上顺畅运行。”欧阳万里透露。
华为与上海人工智能实验室建立了深度合作关系,双方以昇腾超节点算力为核心,围绕开源生态共建、行业AI赋能等领域展开全面合作。
其中,在生态层面,双方共建昇腾书生开源生态,联合举办大模型实战训练营与技术研讨会,面向高校及产业界开展技术赋能,推动自主创新AI技术栈的人才培养与生态繁荣;在创新应用层面,双方联合探索大模型在金融、制造等行业的AI赋能,以昇腾AI集群为算力底座、书生大模型为智能引擎,共同打造软硬自研的行业大模型解决方案,助力重点行业数智化转型。
业内人士表示,AI4S从实验室走向产业化的路径已然清晰,但这条路并非单点突破就能走通。科学大模型的迭代、高质量数据集的构建、算力底座的夯实,三者缺一不可。值得关注的是,一个围绕自主创新技术栈的AI4S生态正加速成型,未来当数据壁垒逐步打通、算力底座持续夯实、科学大模型与自动化实验系统深度耦合,新材料的发现、新药物的诞生、新机理的揭示或将进入“批量涌现”的新阶段。