“除了同构推理,词元(Token)工厂服务的模型种类有很多,有的模型需要大算力,有的要大带宽,有的要低延迟,怎么把它们组合在一起?异构推理就是一个很好的解决方案。”7月18日,摩尔线程(688795.SH)创始人、董事长兼首席执行官张建中在2026世界人工智能大会(WAIC)上如此表示。
《中国经营报》记者注意到,摩尔线程推出基于MTT S5000的PD分离异构推理方案,将高算力需求的Prefill计算池(MTT S5000)与高带宽的Decode生成池(国际主流GPU)异构分离、分池部署,大幅提升性价比。
有关测试显示,基于Kimi K2.5模型推理测试,混合部署MTT S5000+国际主流GPU 3P2D异构方案相比于单独部署国际主流GPU同构方案,平均 TGS(Tokens/GPU/S)提升1.87倍,首字延迟降低56.9%。“大概3台S5000+2台Hxx=9台Hxx。”张建中表示。
在他看来,摩尔线程要做词元时代的“AI工厂”,包括模型训练工厂、词元生产工厂和智能体生产工厂,它们基于夸娥(KUAE)智算集群打造,支撑从训练到推理、从数字世界到物理世界的多元算力需求。
在“模型训练工厂”方面,极佳视界合伙人、副总裁毛继明表示,基于摩尔线程MTT S5000,联合共研完成了驾驶世界模型、驾驶重建模型、具身世界模型、世界动作模型等物理AI模型的训练。
EvoPhys.ai创始人、首席执行官谭桦杰指出,北京大学EvoPhys项目组基于摩尔线程MTT S5000完成全栈原生训练的5D世界模型 EvoPhys-World,连续37天登顶WorldScore“世界生成”维度,标志着国产算力在支撑高水平AI研究方面取得重要进展。
在“词元生产工厂”方面,MiniMax副总裁薛子钊认为,高效的算力基础设施通过多芯片适配(包括国产芯片)等,达成极致的训练和推理性能。
趋境科技创始人、首席执行官艾智远表示,通过将摩尔线程全功能GPU与国际主流GPU深度融合,双方在PD分离异构推理上实现了高品质与性价比的优势互补,真正让国产算力转化为规模化的词元产能。
在“智能体生产工厂”方面,无问芯穹技术副总裁吴保东重点分享了Infini-AIOps运维智能体在摩尔线程夸娥智算集群上的应用实例,实现了从问题发现、分析定位到辅助处置的智能化闭环,为算力基础设施的长远发展树立标杆。
此外,摩尔线程全栈具身智能仿真平台MT Lambda,构建了从底层算力、核心引擎到上层框架及工具的完整解决方案,致力于生产物理世界的智能体。