7月24日,《人工智能关键基础技术具身智能数据集质量要求及评估方法》由工业和信息化部批准发布,将于2026年11月1日正式实施。该标准由中国信息通信研究院联合行业40余家单位共同起草编制,其发布标志着具身智能数据集建设将从“规模导向”向“质量导向”转变,有效填补具身智能数据方向的行业标准空白,为具身智能领域的高质量数据集建设奠定基础。
当前,具身智能沿着大模型“大力出奇迹”的思路,已多次验证数据对具身智能模型的提升作用。2026年,百万小时的数据产能被视为企业研发模型的硬性门槛。行业持续聚焦具身智能数据,不断推出开源数据集,具身智能训练场建设如火如荼。然而,这些数据是否可用、是否好用,业内判断标准不一,导致数据集质量难把控、不同数据集难整合等问题突出。具身智能数据面临“量少质低”的结构性矛盾。

一图读懂《YD/T 6771-2026 人工智能关键基础技术具身智能数据集质量要求及评估方法》
为针对性解决业界在具身智能数据集上遇到的核心痛点,该标准面向具身智能数据集,制定生产操作规范以及组织管理制度规范,围绕具身智能数据集质量描述八个维度的评价指标,让数据“采得准”“结构清”“用得上”“管得住”“评得清”。
具体而言,标准规定了具身智能数据集质量要求框架及评价方法,包括数据生产操作规范、组织机制保障和质量评价指标三方面。其中,具身智能数据集质量评价指标涵盖完整性、一致性、多样性、真实性、易用性、实用性、可扩展性和安全性八个维度评价指标。

具身智能数据集质量要求及评价框架
该行业标准的制定,对拉通具身智能数据集供需双方、推动具身智能数据集高质量建设和互通共享具有重要意义。对数据提供方,统一的质量要求可帮助其规范数据生产流程,明确数据交付质量底线,降低供需双方的沟通成本;对数据需求方,能够提供清晰的质量验收依据,更高效地筛选匹配自身模型训练需求的优质数据集,降低数据采购和使用风险;对整个行业,将推动具身智能数据领域的规范化发展,促进优质数据的流通共享,助力具身智能技术和产业的健康良性发展。