
智元自研的具身原生全模态大模型WITA-Omni Preview登顶DailyOmni榜单。
近日,国际权威具身全模态理解评测榜单DailyOmni公布最新测评结果。智元自研的具身原生全模态大模型WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以85.21 分的综合成绩位列榜首,超过千问、Gemini、豆包、英伟达等国内外主流模型,并在八项细分能力中斩获六项第一。
此次登顶,也意味着智元在机器人面向真实物理世界的全模态理解与交互能力上取得重要突破。
DailyOmni是业内公认评估音视频时序理解、跨模态推理能力的重要第三方榜单。不同于侧重图文或短视频理解的传统评测,它大量采用开放环境中的真实音视频素材,重点考察模型是否能够同时融合视觉画面与环境声音,准确识别声画对应关系、事件发生顺序以及跨模态语义的综合能力。这些能力,正是人形机器人在真实物理空间开展自然人机交互所必须具备的核心能力。
从“会聊天”到“会互动”
对于人形机器人而言,自然交互远比在线聊天更加复杂。机器人不仅需要同时“看见画面、”听见声音,还需要持续判断声音来自谁、事件发生的先后顺序、当前正在与谁交互,以及什么时候应该回应。
传统机器人通常采用多个独立模块完成感知、理解和控制,信息需要层层传递,不仅存在时延,也容易造成语言、动作、表情之间彼此割裂,成为机器人交互体验长期以来的重要瓶颈。
WITA-Omni的创新之处,在于它并非简单将大语言模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker–Talker范式上进一步扩展出面向具身输出的Thinker–Talker–Actor架构。
因此,对于机器人而言,“理解”与“回应”不再是两个割裂的步骤,而成为一个持续发生、实时联动的过程。“看、听、说、动”首次真正融合在同一时间轴上。
千万小时训练,让机器人理解真实世界
WITA-Omni的领先并非单纯依赖模型参数规模,而是建立在面向具身交互的大规模数据体系与针对性训练策略之上。
模型中训练阶段,WITA-Omni基于千万小时级多模态数据进行训练,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。
此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。为此,智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。由此,模型不仅学会“回答正确”,还进一步学会在真实场景中判断:该不该回应、何时回应,以及回应谁。
为具身智能构建交互智能底座
此次在DailyOmni榜单中位居全球第一,也验证了WITA-Omni在物理世界视听时序理解任务上具备独特竞争力。
作为具身智能行业首个机器人原生端到端全模态交互大模型,WITA-Omni的价值并不仅仅在于支持更多模态,而是首次将视觉、听觉、语言、动作、表情统一到同一个认知状态和统一时间轴中,实现机器人持续感知、统一判断、同步表达。
相比传统模块化流水线式交互方式,它推动机器人交互从“依次调用多个模块”迈向“统一生成一个完整交互过程”,让机器人真正具备自然交流所需的在场感、连续性和人格化表达能力,也为具身智能在工业制造、商业服务、公共服务、文旅展演等场景的大规模落地提供了新的技术底座。
未来,依托WITA-Omni构建的交互智能底座,智元将进一步夯实“三智一体”技术架构,与作业智能、运动智能协同联动,持续驱动“本体-数据-模型-场景”四维一体飞轮运转,解锁更多商业场景、公共服务、影视展演等广阔场景。面向未来,智元将持续迭代 WITA硅光动语大模型,不断拉近具身智能与人类沟通的距离,加速具身智能新生产力时代的到来。