• 最近访问:
发表于 2026-07-29 06:23:51 股吧网页版
超越谷歌和英伟达 智元交互模型登顶全球榜首 千问、豆包跻身前五
来源:上观新闻

  7月28日,复旦大学研究团队发布的音视频跨模态推理评测基准“每日全模态交互能力评测”(DailyOmni)最新榜单显示:智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩登顶榜首,超越千问、谷歌双子座(Gemini)、豆包及英伟达旗下模型,并在八项细分指标中斩获六项第一。

  DailyOmni是行业公认的检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方榜单。与传统的图文理解不同,该榜单重点考察模型在真实开放环境下的“全模态感知”能力,即机器人能否在复杂的物理空间中,精准判断“谁在说话”“事件发生的先后顺序”,并做出恰当的交互决策。

  硅光动语则是智元自研的具身原生全模态大模型,属于智元“一体三智”(本体、运动智能、作业智能、交互智能)中的交互智能。针对传统机器人“听、看、说、动”思维割裂、交互生硬的痛点,该模型独创了“思考—表达—行动”(Thinker-Talker-Actor)三层端到端架构。在这一架构下,机器人依靠视觉来理解物理世界,不再额外需要语音或文字指令,实现了感知、决策与表达的统一驱动。

“思考—表达—行动”三层端到端架构。

  “这不仅要求模型‘听得懂’,更要求它‘会看眼色’。”智元技术专家表示,通过千万小时级多模态数据基座与“监督微调—同策略蒸馏—强化学习”三阶段特训,硅光动语大模型不仅具备了音画联合推理能力,还学会了在多人复杂场景中判断“该不该回应、何时回应、回应谁”。

  技术专家还解释称,硅光动语大模型在训练过程中,会同时模拟“老师”和“学生”的角色。其中,“老师”模型在获得额外信息的情况下生成高质量答案,将这种能力复制给无额外信息的“学生”模型,同时再配备“奖惩机制”,让大模型生成内容能保持表达风格统一,并大幅提升复杂音视频上下文中的推理能力。

  值得注意的是,在此次榜单前五名中,除了智元,千问、豆包等多款国产大模型亦跻身前列,彰显了中国人工智能在全模态感知领域的技术优势。

三款国产模型占据榜单前五。

  今年5月,硅光动语大模型通过备案,成为全国首款合规备案的具身智能交互大模型,进入合规商用阶段。记者了解到,硅光动语大模型在未来将与负责物理操作的“视觉—语言—动作”(VLA)模型,以及提供虚拟训练环境的世界模型GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500