7月28日,记者从智元获悉,根据近日公布的具身全模态理解权威榜单 DailyOmni 最新评测结果中,智元自研的具身原生全模态大模型 WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以 85.21分综合成绩登顶榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

DailyOmni是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。不同于面向图文、短视频的常规评测任务,该榜单大量采用真实开放环境音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。
对于人形机器人交互能力来说,以往的全模态模型大多优先适配线上数字内容交互,而机器人身处持续变化的物理空间,不仅需要同步“看见画面、听见声音”,更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机,传统模块化机器人方案很难完成这类时序耦合的复杂推理任务,也是长久以来人机交互生硬割裂的关键瓶颈。
对具身智能机器人而言,“理解”和“回应”并不是两个割裂的步骤,而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。
WITA-Omni 领先的关键,在于它并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker–Talker 范式上进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构。
· Thinker(思考) 是多模态推理核心,把文本、图像、音频、音视频经各自编码器与轻量投影层映射到统一表示空间,做跨模态联合推理和高层交互决策;
· Talker(说) 以 Thinker 的隐状态为条件,流式生成自然语音;
· Actor(动) 由动作头与表情头组成,把机器人动作与表情生成为与语音并列的一级输出——这是 WITA-Omni 面向具身场景的关键扩展。
据悉,WITA-Omni 的领先并非单纯依靠模型规模,而是来自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系,让模型不仅学会“回答正确”,还进一步学会在真实场景中判断:该不该回应、何时回应,以及回应谁。
作为具身智能行业内首个机器人原生端到端多模态交互大模型,WITA-Omni的意义不只是让一个模型支持更多模态,更是让机器人在统一认知状态和统一时间轴上完成感知、决策与表达。它将具身交互从多个模块依次调用的工程流水线,推进为一个能够持续感知、统一判断并同步表达的生成过程:看与听不再割裂,语言与动作不再分离,理解与回应不再是两个独立步骤,让“看、听、说、动”成为一个连续过程,打通了视觉、听觉、语言、表情、肢体动作全模态协同,让机器人不再只是 “会说话的工具”,进化为拥有在场感、人格感的硅基伙伴。
依托 WITA-Omni 构筑的交互智能底座,智元将进一步夯实“三智一体”技术架构,与作业智能、运动智能协同联动,持续驱动 “本体-数据-模型-场景” 四维一体飞轮运转,解锁更多商业场景、公共服务、影视展演等广阔场景。面向未来,智元将持续迭代 WITA硅光动语大模型,不断拉近具身智能与人类沟通的距离,加速具身智能新生产力时代的到来。