2026年的世界人工智能大会(WAIC),叙事主线已经从模型落地到了Agent(智能体)上。
过去几届,WAIC的叙事主线都是“大模型能做什么”,一度谁参数更大、生成更逼真、对话更流畅将成为核心卖点。但进入2026年,以Agent为代表的AI能力从“能说”向“会干”跃迁。
在软件端,Agent也在快速渗透工业、出海、办公等多个场景中,企业Agent嵌入工作流跑通应用任务,工业Agent把图纸拆单从数小时压缩到一分钟。
尽管Agent快速发展,但底层模型之争并未停歇。在本届WAIC上,多家模型厂商借展会窗口集中亮相模型新品,多模态、世界模型、实时交互模型......竞争的天花板还在往上顶。而在展会之外,模型厂商的“较劲”同样风起云涌。
2026年的WAIC讲述的已经不再是“AI能做什么”,而是“AI正在哪里产生价值”。而模型与落地应用之间的竞争与融合,才刚刚开始。
Agent浸入办公、出海、工业领域
随着AI能力从“能说”向“会干”跃迁,AI Agent应用也成为本届大会热度最高的板块之一。从企业办公、出海到工业,Agent正在落地到各类场景中。
“请为我梳理2026 WAIC大会的参观攻略”“我要搭建一个上海AI热力网站”……在腾讯WorkBuddy的展台前,不少参观者体验智能体带来的效率提升。据腾讯方面透露,WorkBuddy目前已成为国内DAU(日活)最高的办公效率智能体。
企业微信Agent“大圆”也在此次WAIC开启“首秀”。南都记者现场体验获悉,大圆直接嵌入企业微信的工作流中,用户向左轻滑即可唤起,随即就可以提问“群里在讨论什么,我该怎么回复”“帮我总结这些数据有什么结论”。另外,即使用户向大圆输入模糊指令,例如“前两天我和同事聊过一个关于零售门店的工作总结”,“大圆”也能快速找到相关内容并呈现。

企业微信Agent“大圆”在此次WAIC上开启展会“首秀”。
除了推出最新的智能体产品以外,厂商也在逐步落地整套的包含云和各类架构在内的智能体方案。当Agent走进企业生产工作流,会面临跨角色、跨系统的复杂需求:开发者关注更快构建部署,安全团队关心权限与审计,业务团队在意效果能否量化,平台团队则聚焦规模化运行的稳定性、性能与成本。
关注到这样的行业需求,在2026 WAIC上,阿里云正式发布Agent Native Cloud(智能体原生的云),并同步推出AgentTeams、Agentic Computer等企业级智能体工具,覆盖基础设施、开发平台和云桌面等多个维度。

阿里云云原生应用平台负责人周琦。
阿里云云原生应用平台负责人周琦在发布时提到,过去一年,业界涌现出大量令人兴奋的AI Agent产品,Agent正成为企业新的生产要素,企业需要把它从一次性的项目成果,升级为可持续建设、持续运营的组织资产。但下一轮竞争比的不是谁拥有更多Agent,而是谁能把Agents变成可控、可复用、可协作、会进化的组织资产。
互动和营销科技服务商极光(Aurora Mobile)今年携EngageLab、GPTBots.ai、Modellix.ai三大AI产品矩阵亮相展会现场。
极光全球市场营销总监全啸宇告诉南都记者,目前极光旗下企业级AI Agent构建平台 GPTBots.ai能通过API工具调用与工作流编排,打通企业原有的ERP、CRM等系统,并结合 EngageLab 全渠道客户互动平台,实现从系统接口调用到自动化触达的业务闭环。
她进一步表示,目前在GPTBots.ai平台上,落地进展最快的行业主要集中在跨境电商、出海服务、不动产管理、泛娱乐以及智能家电等离C端客户更近、高频交互且有跨国运营需求的场景。
极光目前也在辅助企业出海进程。全啸宇表示,在出海场景中,企业让AI直接接管业务,最担心的主要有两点:一是数据安全与合规风险,如数据泄露或违规出境;二是业务风险,如AI误操作或“幻觉”导致的业务损失。针对这些担忧,极光做了三方面的预防,一是通过数据物理隔离确保合规;二是做了精准的工作流编排与API权限管控设置;三是在关键高价值节点设置控制阀,例如前端由GPTBots进行高频AI应答,筛选出的高价值线索则通过 EngageLab平台无缝流转至真人团队接管,实现人机协同。
在工业Agent方面,工业AI公司黑湖科技也亮相展会。与消费端AI主要围绕内容生成和个人效率不同,工业Agent直接影响成本、产能、交期和质量,其商业价值更多取决于能否在复杂生产环境中稳定完成具体任务。
黑湖科技集中展示了覆盖拆单、报价、采购、排程、质检和跟单等环节的工业Agent。以拆单Agent这一典型场景为例,黑湖科技的拆单Agent能理解产品图纸,结合工厂的设备特点、工艺要求和生产习惯,快速生成工序及相应的工艺要求。据悉,过去可能需要数小时完成的图纸解析,如今约一分钟即可完成,在已落地场景中的准确率超过95%。
底层基础模型之争持续上演
尽管“智能体”已成为2026年行业发展的关键词,但头部厂商并未因此放缓大模型研发的步伐。在本届WAIC上,多家模型厂商借展会窗口集中亮相模型新品,用产品迭代证明:底层模型之争远未到终局。
MiniMax围绕多模态能力,在WAIC同步展示了覆盖视频、语音、音乐和创作工作流的产品矩阵。其中,MiniMax新一代多模态生成模型H3抢先预热。据悉,作为从“特化任务模型”迈向“通用多模态智能”的新范式代表,H3面向由文本、图像、视频与声音共同构成的多模态上下文,统一理解创作意图,完成更加自然、连贯的生成与表达。

MiniMax新一代多模态生成模型H3在此次WAIC上抢先预热。
直播平台虎牙最新亮相的VAM1.0基础模型引起了广泛关注。现场演示显示,向VAM1.0输入一张静态图片,该模型就会输出一个能实时说话、实时交互的数字人。目前VAM已赋能游戏互动、观赛陪伴、游戏道具带货等多个场景。
虎牙CEO黄俊洪认为,数字人从展示型产品走向实时交互型应用,需要同时解决稳态、拟态和动态三类问题,即长时间生成不崩、表情动作足够自然,以及能够实时聆听、实时反馈、实时互动。
据悉,VAM后续将分阶段持续迭代,在推理效率、模型表现力和成本优化三个方向同步推进,最终实现多模型融合与低成本人物风格定制。
模型厂商模思智能此次展出了其在实时视频理解、复杂音频转写、语音及音视频生成和实时交互等领域的最新进展。
在展台侧,模思智能设置了Mossland创作电话亭和VBTI(Voice-Based Type Indicator)声音人格测试。据悉,电话亭底层调用模思自研的MOSS-TTS Family语音合成模型,南都记者现场体验,像打电话一样随意说出一个想法,该模型即可为影视片段配音、生成AI播客,或得到一张记录当下声音的“声音保鲜发票”;另外在VBTI区域,对着麦克风讲一段话,系统则会生成一张呈现语速、节奏、语气和情绪的“声音人格卡”。

说出一个想法,模思自研模型会将想法变为一段播客。
昆仑万维在展会期间发布Matrix-Game3.5交互式世界模型、Murekav9.5音乐大模型等重磅迭代产品,宣告公司技术路线从虚拟世界内容生产,正式向物理世界具身智能场景延伸。
昆仑万维董事长兼CEO方汉认为,过去两年AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。但从2026年开始,AI的核心命题将转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动,而世界模型正是实现这一跨越的关键技术底座。
今年行业有声音认为,AI发展重点将从模型层转移到应用层。方汉则表达了不同的观点。他认为,应用层能力随时可能被大模型的发展所包含和内化,因此单纯做应用层“非常危险”。他举例称,此前备受关注的 Skills(技能编排)能力,在最新一批文本大模型发布后反而出现了“使用Skills效果不如不使用”的现象——原因在于,这一批大模型普遍采用业界公开的Skills进行训练,使其原生能力已覆盖原有应用层功能。
他强调称,各厂商仍应专注于模型本身。同时他也指出,做应用并非不可行,但前提是必须确保应用所产生的数据与流程能够被大模型所内化,而非停留在模型之外成为可被轻易替代的独立能力。
在展会之外,模型厂商的“较劲”同样风起云涌。
WAIC期间,Kimi K3的2.8万亿参数在行业快速引发热议。智谱并未参加此次WAIC,但智谱AI已落地1GW级国产AI算力数据中心建设,并全部采用国产AI芯片。与此同时,智谱也正式完成了对国产AI异构算力软件公司中科加禾的收购。
展台内外,模型厂商传递出的信号是一致的,即大模型赛道没有走向沉寂,只是在换挡加速。从单模态走向多模态,从“生成”走向“理解与交互”,从虚拟内容走向物理世界,模型能力的边界,仍在不断往外推。
出品:南都政商数据新闻部