21世纪经济报道记者彭新
2026年,具身智能热度持续攀升。在刚刚结束的2026年世界人工智能大会(WAIC)上,机器人企业竞相亮相,多家公司发布新模型和产业合作进展。行走、抓取、分拣、导览、巡检等能力被密集摆上展台,机器人本体日趋成熟,可演示的动作也日益丰富。
“这就是我们行业的期中大考。”艾欧智能联合创始人丁哲章对记者说,作为具身智能数据基础设施厂商,艾欧智能观察到,行业的关注点已从本体能否运动,转向机器人能否进入真实场景、持续完成任务。
过去一年,VLA、世界模型等具身模型加速迭代,人形机器人开始进入工厂、仓储和服务场景。机器人正从“能走会跳”走向“可以干活”,不仅要持续完成抓取、分拣和装配等任务,还要与人、设备甚至其他机器人协同执行复杂流程,由此带动训练数据、推理算力、云端调度和远程运维需求增长。
具身智能被市场视为潜在的万亿级赛道。在这场从“能唱会跳”迈向“进厂干活”的行业转向中,科技巨头难以置身事外。不过,与不少厂商直接下场制造本体不同,腾讯给出的答案是:不造机器人。
算力、数据需求都变了
机器人真正进入应用场景后,不仅是算力需求在增长,算力和数据的使用方式也在发生变化。
传统大模型的训练数据以文本、图片和视频为主,具身智能则额外纳入第一人称视频、深度信息、点云、关节位置、动作轨迹,以及触觉与力觉等数据,这些异构数据还必须按统一时间戳严格对齐,才能完整还原机器人在某一时刻看到了什么、做了什么,以及结果如何。
“视觉主要帮助机器人判断‘想做什么’,触觉和力反馈则帮助它判断‘做得怎么样’。触觉的短距离反馈可以快速与力度控制建立联系,让机器人根据物体材质、形状和受力状态即时调整动作。”IEEE会员、桐元软件CEO胡凝进一步向记者解释。
他表示,未来机器人需要从单一视觉感知,发展到“视觉—触觉—力觉”多模态闭环。这种协调不能只依赖语义理解和逐步逻辑推理,而需要通过边缘计算,在毫秒级时间内实现感知与动作的联动,听觉等其他感知能力也可以进一步参与其中。
数据规模扩大后,企业首先面对的是存储问题。灵巧操作企业灵初智能成立初期,采集数据量有限,可直接保存在本地,随着数据采集体系逐步搭建,海量第一人称视频、机器人动作与关节数据需要被存储、筛选和加工,再投入模型训练。对创业公司而言,自建并持续运维一套可扩展的数据系统,成本压力正不断加大。
到需要自建数据采集体系时,情况发生了变化。“数采未来一定和工厂化的硬件、基建类似,需要做的东西非常多,作为一个创业公司自己去负责,性价比很低。”灵初智能联合创始人陈源培说。灵初评估了多家云厂商方案后,最终将整套数据管线和数据平台搭建在腾讯云上,训练算力也主要来自腾讯云。
实际来看,数据规模的提升速度超出了双方预期。陈源培介绍称,目前数采厂尚未全面启动,日产数据数千小时,下半年全部投运后将升至上万小时。腾讯云存储解决方案专家架构师杨冠军表示,今年云上具身智能客户的数据量已达数个PB(1PB约等于1024TB)级别,其手中的具身客户数也从去年年初的少数几家迅速增长。
相比单纯增加存储容量,更大的挑战在于数据处理,即如何从海量原始数据中筛选出真正有效的部分。
“10万小时人类数据,有时候可能不如1000小时有效。”陈源培说。他举例称,向数采方下发1000个任务、每个采集100小时,与同样1000个任务、每个只采1小时,作用其实是等效的,在同一任务上不断叠加时长,对模型能力的边际贡献会迅速衰减。
陈源培称,真正决定训练效果的,是手部姿态估计是否准确、任务标注是否足够细致等关键因素。他援引特斯拉的例子指出,FSD 12最终使用的高质量数据约80万小时,但实际采集量达到几千万小时。这意味着,具身智能的数据竞争正从单纯追求采集规模,转向能否找到并处理高质量数据。数据采集之后,还要经过分割、姿态估计、动作修正、质量评估、标注和格式转换等步骤,才能进入训练环节。每一步都可能调用不同模型,也会产生新的算力需求。
对腾讯云等云厂商而言,这意味着服务范围也在延伸,过去主要向具身智能公司提供GPU和存储资源,未来则要进一步覆盖从数据准备、模型训练到部署运维的完整流程。
艾欧智能以机器人遥操作系统切入这一行业,通过VR、动作捕捉、外骨骼手套和力反馈单元把人的操作映射到机器人上,用于采集高质量任务数据。
丁哲章称,公司最初做的是本地操作,人就站在机器人旁边,“其实不需要经过网络,甚至不需要太多算力,用一个端侧方案就能很好地解决”。但当人与机器人分处两地,情况发生了变化:一方面需要一套中间传输层,确保控制与图像数据稳定传输;另一方面,数据的处理与传递需要算力支撑,须调动云端资源辅助传输与计算加速。
2025年,艾欧智能实现了人在深圳远程操控位于美国的机器人。在这一过程中,腾讯云提供了远程操控、实时音视频和网络传输能力。此后,双方又将方案由机械臂操作扩展至机器人全身遥操作。
实际上,机器人进入应用场景后,计算也不可能全部放在云端。碰撞、失衡等动作需要机器人快速反应,底层控制频率可能达到数百赫兹,必须在端侧完成;任务理解、环境认知和长链条规划对实时性的要求相对较低,可以调用云端大模型。
“之前我一直在训2.5B的模型,因为端侧压缩到极致,部署在80 TOPS及以下算力的时候,2.5B左右的模型效果跑得比较好。但后来发现,我们想要上一些高成功率的动作,比如插USB这个动作,模型参数量低于20B甚至30B就没有什么作用了。”家庭机器人公司乐享科技联席CTO李元庆告诉记者,当需要调用长程任务和指令遵从能力时,就只能上云了。
以此来看,算力被切分为不同层次:底层运控与快速反应留在端侧,大模型训练、复杂推理和长期记忆更多放在云端,中间再通过网络与调度系统连接。具身智能需要的已不是单一GPU资源,而是计算、存储、网络和数据处理协同运行的基础设施。
做机器人大脑
需求变化也在推动腾讯重新定义其在具身智能产业的位置。
长期以来,腾讯明确表示不会涉足机器人量产。腾讯首席科学家、Robotics X实验室主任张正友指出,中国机器人硬件供应链已具备较强制造能力,机器人本体企业数量多、迭代速度快。相比重复布局硬件制造,腾讯更适合发挥AI、云计算、软件平台和连接能力的优势。
他将未来机器人产业类比为手机和个人电脑市场:一部分企业会像苹果一样,从硬件到操作系统和应用实现全部闭环;另一部分企业则可能基于统一的软件平台,开发不同本体和应用,类似安卓和Windows。
腾讯试图成为后一种生态中的平台提供者。
2025年7月,腾讯发布具身智能开放平台Tairos,随后上线多款具身智能模型并落地多个真实场景,其核心是在算力、存储和网络之上叠加模型、智能体与开发工具等,将底层资源封装为机器人企业可直接调用的能力。
在本次WAIC上,腾讯发布了三个具身基座模型Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0、Hy-Embodied-VLA-0.5,以及两个具身智能体Apexio和TairosAgent。
据张正友介绍,VLM负责理解图像、空间与场景,包括物体的深度、方位、可操作部位,以及长时程任务中的进度跟踪与失败重规划;RxBrain负责统一认知与规划;VLA则将高层目标转化为连续、可纠错的动作。两个智能体分工不同:Apexio使认知、感知行动与底层执行三层能力同时在线、以不同频率持续运行;TairosAgent则通过统一的硬件适配层和标准化Skill接口,将上述能力复用到不同模型、技能和机器人形态上。
对机器人公司而言,这可以减少重复开发。并非每一家本体厂商都有能力训练具身模型,也不是每一家产品公司都能分别组建语音、视觉、大模型、安全和云端运维团队。腾讯希望通过Tairos提供统一入口,让厂商选择合适的模型、技能和云服务,再接入自己的本体和场景。
平台价值首先体现为适配不同机器人。
过去一年,腾讯已与宇树、智元、越疆、松延动力、乐聚、华沿等机器人企业开展合作,场景合作方包括博世、蓝思等。张正友称,Tairos最初在一款机器人上完成适配耗时约三个月,此后迁移到其他本体的时间缩短至数天,近期适配一款机器狗只用了约一天。
缩短适配时间的关键,是在平台底部增加硬件抽象层,将不同机器人在传感器、关节和控制接口上的差异封装起来。上层规划、感知和交互能力可以保持相对稳定,机器人特有的能力则通过标准接口调用。
工业场景的门槛则更高,张正友称,虽然机器人在实验室模拟环境中效果不错,但真实产线要求更严苛。据腾讯披露,Hy-Embodied-VLA-0.5已进入一家日化品工厂开展生产实测,该产线具有高混合、小批量、新SKU更新频繁等特点,要求成功率高于95%、单次操作节拍快于6秒,新增SKU的数据采集和模型后训练时间不超过3天。腾讯称,该模型已满足上述要求,下一步将继续推进真实产线应用。
面向消费级机器人的落地方式不同。消费级机器人企业乐享科技是腾讯云Claw Pro的首批内测用户,目前先在Mini 1产品上进行试点,再逐步扩展至其他型号。Claw Pro基于开源智能体框架OpenClaw,在其之上补入记忆插件、个人空间等能力,向机器人厂商提供云端智能体底座、记忆管理、技能生成与安全审计。
张正友表示,Tairos进入企业后,团队往往需要驻场数月,根据生产节拍和工人经验采集数据、调整模型。“最后一步需要付出很多系统和工程上的努力。”