2026世界人工智能大会(WAIC 2026)期间,算力结构性失衡成为全行业共识,而智能体规模化落地正在催生指数级算力需求,单智能体Token消耗可达传统对话模型数百倍,长上下文、多轮协同推理进一步放大资源消耗压力。
问芯穹联合创始人兼 CEO 夏立雪对《中国经营报》记者表示,从Pre-training(预训练) 到Post-training(后训练)、从Test-time(推理时扩展) 到Agentic scaling(智能体扩展),在四条 Scaling Law 的作用下,模型训练和推理的超级市场正在互相孕育。当下的人工智能基础设施(AI Infra)必须以极致的效率服务更大规模。在此背景下,无问芯穹推出Agentic Infra 的“前店后厂一中心”战略布局。
搭建算力全链路价值闭环
当前国内算力市场存在几类长期难以解决的共性问题:跨区域、跨代际、公私混合算力形成资源孤岛,无法统一调度;推理环节不同芯片性能侧重差异明显,同构集群资源浪费严重;算力与垂直行业业务脱节,Token生成后难以高效转化为产业价值。
夏立雪认为:“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”
无问芯穹Agentic Infra自主式基础设施平台的核心目标,就是实现智能资源规模最大化。据介绍,Agentic Infra 它就像一座“算力集散中心”,把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。
无问芯穹通过跨域训练系统完成三类规模化场景验证,覆盖超远距离跨地域、多代际GPU集群、公私混合云算力互通,核心思路是通过通信、调度、框架全栈协同优化,打破算力孤岛。这套调度体系已经接入全国数万P算力,兼容十余种主流芯片,同时针对智能体依赖的跨集群强化学习做容错优化,解决万卡级集群故障频发、任务中断的行业痛点,核心逻辑是盘活存量算力,而非单纯新增硬件投入。
中间层Token工厂聚焦推理效率,适配推理算力成为市场增量的行业趋势。IDC数据显示,2027年推理算力需求将占整体智能算力七成以上,智能体长上下文、高频交互的特性,对推理时延、缓存复用、单Token成本提出严苛要求。传统同构推理集群无法发挥不同芯片差异化优势,Prefill与Decode任务混跑造成硬件性能浪费。
行业内多数厂商仅聚焦单集群内部推理优化,跨集群异构调度方案落地案例较少。无问芯穹推出三级分离推理架构,根据芯片性能分工分配推理任务,搭配缓存压缩技术降低跨集群传输损耗,实测有效压低单位生成成本。依托这套推理体系,其MaaS服务平台调用规模实现大幅增长,也与运营商、AI社区合作搭建通用模型服务门户,本质是依靠系统优化降低推理业务的硬件依赖,缓解算力紧缺带来的成本压力。
补齐数字与物理世界算力支撑短板
随着具身智能产业逐步从实验室走向小规模商用,新的算力矛盾正在显现:云端训练集群、边缘算力节点、机器人真机分属三套独立体系,数据传输链路长、跨域协同不稳定,真机大规模强化学习带宽成本居高不下。
夏立雪将视野从云端的数字世界延伸至真实的物理世界。他提出:“在物理世界中,具身智能的 Scaling Law 同样需要高效率、大规模的基础设施支持。”
无问芯穹推出了在具身智能领域首个面向大规模具身任务的云边端一体化管理与调度平台。该平台首次把云端 GPU 集群、边缘算力节点和机器人真机设备统一接入到一个平台中,支持训练、数据采集、评测和真机执行等多种具身任务统一编排运行,有效解决了具身训练中资源分散、跨集群协同困难、任务角色复杂、真机状态不可见、启动链路长的问题。
据悉,从实验室到产业,无问芯穹与智元、清华大学探索了真机强化学习训练的技术与实践,攻克阻碍真机强化学习训练大规模落地的核心痛点与难点。
“让智能无所不能,是AGI,而让智能无处不在,是 AGI Infra。”夏立雪在发布会的尾声中说道,“AI 无疑是目前世界上发展变化最快的行业,但我们的初心从未改变,就是做 AGI 时代最需要的 AI Infra。”