7月28日,在2026中国国际大数据产业博览会新闻发布会上,国家数据局副局长余英介绍,截至6月,全国已建成高质量数据集超12万个,总体量超过1565PB。
加快推进更多高质量数据集的建设
国家数据局从成立伊始就高度重视数据要素赋能人工智能发展工作,坚持系统谋划、协同推进,不断完善高质量数据集的建设、评测、管理体系的构建,持续推进数据要素赋能人工智能创新发展。
余英评价:“经过这几年的持续努力,目前在全社会已形成了‘人工智能+’到哪里,高质量数据集建设和应用就到哪里的良好氛围。”
当前,高质量数据集建设规模快速扩容。国家数据局会同高质量数据集建设链主单位、先行先试单位,围绕科学研究、工业制造、农业农村、具身智能、低空经济等领域,分类推动高质量数据集建设。
余英介绍:“高质量数据集已经成为人工智能快速发展的关键‘燃料’。国家数据局也在加快推进更多高质量数据集的建设。”
此外,高质量数据集管理规范体系日益健全。
据了解,国家数据局指导全国数标委研制《高质量数据集建设指南》《高质量数据集格式要求》《高质量数据集分类指南》等5项国家标准,初步构建起“数据质量检测+基准模型验证”相结合的高质量数据集质量检测方法和工具。目前已对12个数据集、超4563万条数据完成检测,为数据集的可信可用提供了保障。
探索词元交易等新型交易模式
在今年4月第九届数字中国建设峰会上,国家数据局上线了国家数据集管理服务系统,构建了“物理分散、逻辑集中”的数据集资源目录统一管理机制。截至6月底,系统已认证各类供需主体578家,上架数据集1433个,促进数据集供需主体有序对接,数据集流通利用生态加速形成。
国家数据局鼓励基于词元应用的商业模式创新。余英表示,将探索词元交易等新型交易模式,培育“为优质数据付费”的市场共识。深化词元应用与工业、医疗、金融等领域的深度融合,助力人工智能应用规模化落地,推动形成以模型应用牵引数据供给、以数据赋能模型迭代的良性供需互动,形成“数据飞轮”效应。
澳洲会计师公会华东和华中区委员会会长金科向记者表示,中国依托低廉工业电价、“东数西算”绿电消纳、完善算力集群,形成极强成本优势,国产模型定价仅为美国头部厂商1/10左右;2026年一季度中国大模型全球词元调用量占全球61%,海外客户近半数来自美国、欧洲中小企业。
谈及下一步工作,余英表示,国家数据局将持续推进行业高质量数据集建设,深入实施数据赋能人工智能六大专项行动,推动行业高质量数据集建设推广与“人工智能+”同频共振、互促共进,强化数据赋能人工智能创新发展。
金科认为:“当前全球正在形成一套全新的竞争逻辑:词元是前台产品,算力是生产线,电力与能源体系是工业血液与国土底层禀赋,三者共同构成数字时代新的国家核心竞争力。人工智能产业具有重耗能、重资产、长周期的工业属性,彻底改变了竞争要素。芯片决定能不能造高端算力,电力决定能造多少算力,全国性能源体系决定算力能否长期稳定、低成本量产。”