近日,具身全模态理解权威榜单DailyOmni最新评测结果正式揭晓。智元自研的具身原生全模态大模型WITA-Omni Preview凭借领先的音视频联合理解与时序推理能力,以85.21分的综合成绩登顶榜首,并在八项细分指标中斩获六项第一。
值得关注的是,在这份榜单中,除了智元排列第一,我国亦有包括千问、豆包等多款大模型跻身前五,显示了中国人工智能在全模态感知领域的持续探索与创新活力。

受访者供图
测评是真实物理空间的“全模态大考”
作为行业公认的第三方权威榜单,DailyOmni主要检验大模型的音视频时序对齐与跨模态联合推理能力。不同于以往面向图文、短视频的常规评测任务,该榜单大量采用了真实开放环境下的音视频素材。它核心考验的,是模型如何融合视觉画面与环境音频信息,精准识别“声面对应”关系以及事件发生的先后顺序。而这恰恰是人形机器人走进现实生活、开展自然交互的“敲门砖”。
在过去的印象中,人们与机器人的对话往往像是在使用对讲机,一来一回,显得生硬而割裂。智元灵创业务部总监兼玻色子实验室主任黄少立在接受新民晚报采访时,一针见血地指出了行业痛点:“以往的全模态模型大多优先适配线上数字内容的交互,但机器人的实际工作场景却是持续变化的物理空间。”
这就意味着,机器人不能只是简单地把聊天模型“装进”躯壳里。黄少立解释说:“对具身智能而言,‘理解’和‘回应’并不是两个割裂的步骤,而是一个持续的物理过程。一个真正自然的交互,要求机器人一边观察环境、一边接收声音;同时,一边组织语言、一边配合动作和表情。传统模块化方案很难完成这类时序耦合的复杂推理,这也是长久以来人机交互不自然的症结所在。”
架构重构让“看听说动”化为一体
为了让机器人学会在多人、开放的真实环境中“察言观色”,智元WITA-Omni并不是简单地把聊天模型“装进”机器人,而是独创了三层架构,将物理动作和表情提升为与语音并列的一级输出。
黄少立介绍说,在这个“Thinker(思考)–Talker(说)–Actor(动)”的原生端到端架构中,核心的Thinker负责多模态推理,把文本、图像、音频等信息映射到统一表示空间,做跨模态联合推理和高层交互决策;Talker则负责流式生成自然语音;而Actor是面向具身场景的关键扩展,同步控制机器人的动作与表情。由此,具身交互从以往多个模块“排队调用”的流水线,进化为了一个持续感知、统一判断并同步表达的过程。“看、听、说、动”不再割裂,机器人也逐渐摆脱了“会说话的工具”这一刻板印象,开始进化为拥有“在场感”的硅基伙伴。

受访者供图
千万小时高质量素材“喂养”模型
WITA-Omni之所以能跑赢,靠的并非单纯堆叠模型规模,而是一套围绕具身全模态交互打磨的“数据+算法”组合拳。
据介绍,在训练阶段,团队首先引入千万小时级的多模态数据,将强文本与视觉底座升级为能够“听得见、看得懂、可音画联合推理”的全模态大模型。针对公开音视频数据普遍缺乏“交互轮次、响应时机以及动作表情”等接地气信息的痛点,智元专门构建了以人为中心、完整保留音画与肢体语言天然时序关系的真实场景数据集。
有了海量“养料”筑基,模型还经历了“SFT–OPD–RL”三阶段的精细打磨:先通过监督微调(SFT)练就全模态理解与多流生成的基本功;再借助同策略蒸馏(OPD),让掌握时间区间和目标对象等特权信息的“老师模型”,将音视频上下文推理精髓精准传授给不依赖特权信息的“学生模型”;最后通过覆盖时间匹配、目标选择、等待或回应决策等多维奖励信号的强化学习(RL)与GRPO算法,对Thinker的交互决策能力进行全面调优。“通过这套严密的训练,模型不仅学会了‘回答正确’,更学会了在真实场景中自主判断:该不该回应、何时回应,以及究竟在与谁交互。”黄少立说。
据透露,WITA-Omni在设计之初就具备“通用”基因,原生适配各类机器人本体。目前,其核心能力已完成验证,具备了跨本体部署的基础,正加速集成到智元全系列产品中。未来,它将作为驱动具身智能落地的“统一交互底座”。智元将继续完善“三智一体”(交互智能、作业智能、运动智能)技术架构,通过硬件、数据与应用场景的互相促进,推动人形机器人真正落地于商业服务、公共服务及影视展演等现实场景,让人与机器的沟通不再有距离感。
此外,另据消息,7月24日,智元创新(上海)科技股份有限公司(简称智元)确认启动赴港上市流程。