8月3日,自变量科技(深圳)股份有限公司(以下简称“自变量机器人”)发布HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)并开源,能让机器人仅观察一段数十秒的人类视频就学会新技能,同时保留已掌握的技能。
据悉,HOST采用了一种开创性的方法:不去将人类动作翻译为机器人动作并试图模仿,而是让机器人先想象执行动作后的结果,再从结果中拆分出需要执行的动作。
这种全新方法的效果令人欣喜:机器人从一段29秒人类视频中学习技能的成功率高达62%,超越零样本基线45%。相比Pi-0.5+微调方案,HOST所需数据量大幅减少,学习技能速度较主流方法提升500倍。
HOST的思路来自认知科学中的“观察学习”理论:人类面对不熟悉的任务时,不需要通过长期练习或者穷举来学习,而是以先验能力在大脑中模拟动作的预期效果,然后执行相应动作。
自变量机器人研究人员受此启发,将HOST的学习方案从“训练时微调循环”变为“推理时技能获取”,让机器人通过观察人类执行任务来学习新技能,仅从一段数十秒的人类视频去学习技能,成功率则远超主流模型经过后训练微调的效果。不仅如此,HOST还能随时调取技能,解决了“灾难性遗忘”的问题。
HOST的核心部分是一个带有视觉预测功能的级联策略模型。它采用双专家MoT架构,如同两个分工明确的大脑:“视觉大脑”(视频专家)专门处理视频画面、定位任务进度、预测未来图景;“动作大脑”(动作专家)负责将预测图景转化为需要执行的动作,并控制执行。
对此,自变量机器人团队表示:“在具身智能走出实验室、走进千家万户的进程中,不应该只靠专业人员采集数据、反复训练来获得新技能。人与人之间通过示范传递技能,是更加自然高效的学习方式。HOST将技能获取从少数人的专业流程,转变为任何人都能用一段视频完成教学。”
目前,HOST的研究论文和代码已经全部开源。未来机器人在家庭劳动时,有望摆脱专业化的数据采集和训练过程,通过直观的人类演示就学会新技能。这将让智能机器人成为真正贴心可用的“家庭伙伴”,让智能机器人服务人类的每一天。