• 最近访问:
发表于 2026-07-31 15:28:51 股吧网页版
200个任务、1700万帧!大晓把真实家庭场景变成物理智能“数据引擎”
来源:上观新闻

  你是否想过,为什么扫地机器人能躲开茶几,却常常卡在拖鞋上?为什么机械臂能在工厂里精准焊接,却连叠一件T恤都手忙脚乱?

  问题的根源在于:机器人看见了动作,却没有看见完整的物理过程。

  过去几年,人工智能在“看懂”图片和视频上进步神速,但一旦走进真实的厨房、客厅,它们就变得笨拙——因为打开橱柜、倒水、叠衣服这些日常行为,远不止“眼睛看到”那么简单。它们同时涉及视觉、全身运动、手部精细操作、物体状态变化、声音反馈、触觉感知,以及前后步骤的连贯规划。普通视频只能记录“发生了什么”,却无法告诉机器人:接触何时发生?力度如何变化?物体怎样运动?当前动作和前后的任务是什么关系?

  今天,这个问题迎来了一次重要突破。大晓机器人联合新加坡南洋理工大学 S-Lab 实验室,正式开源全球首个L5级多模态具身物理智能数据集——ACE-Data-0。这套数据集不是简单的视频合集,而是一套让机器人从“观看”走向“体验”的高质量数据基础设施。

为什么数据比算法更关键

  在人工智能领域,有一句话广为流传:数据是燃料,算法是引擎。但对于机器人学习物理世界来说,燃料也分“粗油”和“精炼油”。

  大晓团队提出了一套具身数据分级标准:L1-L2级数据只能让机器人完成基础识别和简单预训练;L3-L4级数据能让机器人学会重复已知任务;而L5级数据,则要求机器人不仅能执行,还能理解、反思和进化——这正是 ACE-Data-0 所处的层级。

  ACE-Data-0 的核心突破在于:它不只记录“动作”,而是高保真记录真实物理交互过程中每一次接触压力、每一次自然出现的犹豫和恢复,以及真实家庭场景中那些开放、不可预测的行为变量。简单说,它把日常生活本身变成了机器人的课堂。

从桌面到房间:两套系统“双管齐下”

  精细的手部操作和跨房间的长程活动,对数据采集提出了完全相反的要求。

  捏起一颗葡萄、拧开瓶盖,需要近距离、高精度的传感器;

  在厨房、客厅、卧室之间来回走动,则需要广覆盖、全局视角。

  为此,大晓设计了两套互补采集系统:

  桌面尺度系统专注于精细手—物交互。它在操作台周围布置多台摄像机、光学动作捕捉设备和触觉传感器,重点记录抓取、倾倒、擦拭、切割、折叠等任务中手部姿态、物体轨迹和接触变化。它回答的问题是:“手和物体如何精细互动?”

  房间尺度系统则覆盖厨房、餐厅、客厅、卧室等完整家居空间。通过广角摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动,以及发生在不同位置的连续交互。它回答的问题是:“人如何在完整环境中移动、规划并完成任务?”

  两套系统共享统一的采集、同步、标定和标注流程,确保数据在精细度和广度上都能兼顾。

150小时、1700万帧、50位真人参与

  ACE-Data-0的数据量相当可观:150小时连续记录、1700万帧视频画面、200个任务类别、50名真实参与者、2个真实家庭场景、7.5万个交互片段。

  这些数据覆盖了三大类任务:

  原子级人—物交互(单次约3分钟):倒水、清洗、擦拭、切割、折叠等单项操作,即使在最短序列中也以分钟计,远超传统数据集“数秒片段”的局限。

  长时序家庭活动链(可持续20—30分钟):例如从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾的完整流程。

  人—场景交互(约5分钟):包括移动、坐下、锻炼、开关家具、取放物品及姿态转换等。

  值得一提的是,数据采集采用目标级指令而非脚本化流程。参与者只被告知最终任务(比如“准备一顿简餐”),但不被规定具体步骤。他们可以自由选择物品、操作顺序和路径,过程中可能出现犹豫、改变计划、返回上一步或应对意外情况。这些“不完美”恰恰是机器人进入真实世界必须学会面对的现实。

把所有信号锁定在同一时空

  多模态数据的真正难点,不在于设备够不够多,而在于不同设备产生的数据能否精确对齐。

  摄像机、动作捕捉系统、触觉手套、音频设备各有独立的时钟和不同的采样频率。哪怕只有几毫秒的偏差,就可能出现“画面中手还没碰到杯子,触觉信号却已经产生”的错位。

  ACE-Data-0通过严格的时间同步与空间标定,把视频帧、人体动作、物体状态、触觉读数和音频全部统一到同一条时间线和同一个空间坐标系。这意味着,研究者可以精确找到某一帧画面所对应的人体姿态、物体位置、接触压力和声音变化,也可以直接对比第一人称视角与第三人称视角下的同一事件。

  这种“时空锁定”让数据从一堆杂乱的信号流,变成一份对同一物理过程的完整、统一的记录。

不只是评测,更是通往真实世界的“数据底座”

  基于 ACE-Data-0,大晓还建立了三级评测基准,系统检验模型的真实能力:

  第一级:底层信号推断——模型能否从视觉中预测接触与触觉?

  第二级:场景要素恢复——模型能否在遮挡和复杂运动中还原人体与手部状态?

  第三级:具身交互理解——模型能否理解完整的抓取、调整、释放等手—物交互过程?

  研究团队对30多种主流模型进行了评测,结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显短板。这套基准不只判断“任务是否成功”,更帮助研究者定位“模型究竟在哪一步失效”。

大晓机器人发布三大核心成果,加速物理AI迎来“开悟时刻”

  而ACE-Data-0的价值远不止于评测。由于它包含了统一时空框架下的第一人称视频、多视角第三人称视频、人体与物体轨迹、音频、触觉和语言标注,它可以直接服务于模仿学习、机器人策略学习、世界模型、视觉—语言—动作模型(VLA),以及人类示范向不同机器人本体的迁移。

“0”是起点,不是终点

  大晓团队表示,ACE-Data-0 中的“0”寓意着起点——这是他们具身数据体系建设的第一步。

  未来,他们将围绕具身数据引擎、通用具身基础模型、世界模型和 VLA 持续推进研发,并与研究机构、开发者及产业伙伴共同探索从人类自然行为到机器人通用能力的可拓展路径。

  从“看见动作”到“理解行动”,从孤立视频到连续物理过程——ACE-Data-0 正在为具身智能建立一条更接近真实世界的数据入口。让每一次真实生活中的感知、接触与行动,都成为机器人理解物理世界的训练信号。

  数据已经开源,欢迎全球研究者和开发者共同探索,让机器人真正“走进”我们的日常生活。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500