• 最近访问:
发表于 2026-07-24 17:01:21 股吧网页版
2万亿参数时代来临 超节点成AI大模型竞争新战场
来源:中国经营报

  AI大模型的竞争,正在迈入一个新的阶段。

  7月23日,阿里云方面宣布,搭载真武M890芯片的超节点已完成对2.4万亿参数Qwen3.8的适配,并上线百炼平台提供模型推理服务。这也是国内首个成功运行超2万亿参数大模型的超节点。

  阿里云方面表示,通过芯片、云平台、模型协同优化,在Agentic推理场景中,该超节点性能最高可提升1.5倍,但实际表现仍会受到上下文长度、并发量及模型精度等因素影响。

  这一发布,也让AI产业竞争的新逻辑浮出水面。在刚刚过去的WIAC期间,《中国经营报》记者观察到,越来越多的大模型厂商开始将展示重心从过去的参数规模,转向推理效率、算力供给和基础设施能力。这也似乎预示,一场围绕AI基础设施的新竞争,正在模型竞赛之外悄然展开。

  从“模型竞赛”走向“推理竞赛”

  今年以来,大模型仍在沿着Scaling Law(规模定律)持续演进。

  继Anthropic、OpenAI等厂商不断刷新模型能力之后,国内头部企业也继续向更大规模迈进。阿里发布参数规模达2.4万亿的Qwen3.8,月之暗面推出参数达到2.8万亿的Kimi K3。虽然业内对于参数继续扩张是否仍具备足够的边际收益存在讨论,但头部厂商并没有停止向超大规模模型演进的步伐。

  不过,与上一轮竞争不同的是,参数增长已经不再只是模型研发团队面临的问题,而开始向整个AI基础设施体系传导。

  业内人士普遍认为,当模型规模进入万亿甚至数万亿参数时代后,已经无法依靠单卡GPU或普通AI服务器完成部署,而需要采用大规模模型并行、专家并行(MoE)等技术,将模型参数拆分部署到数十甚至上百张AI芯片上协同运行。这意味着,大模型竞争开始从单纯的软件算法竞争,逐渐演变为芯片、互联网络、交换架构、显存、数据中心以及云平台协同能力的综合竞争。

  相比训练阶段,推理正在成为更加现实的挑战。

  训练往往属于阶段性投入,一旦模型完成训练,其成本相对固定;而推理则伴随每一次用户调用持续发生。随着AI助手、AI Coding、深度研究以及通用Agent逐渐成为主流应用,一次任务往往需要处理超长上下文、连续调用多个工具,并进行复杂的多步骤推理,其计算时间和Token消耗远高于普通聊天问答。换言之,Agent越智能,后台需要持续投入的推理算力也越庞大。

  而这种压力,已经开始传导至用户侧。

  7月19日晚,在Kimi K3发布仅三天后,月之暗面便宣布暂停接受新的用户订阅,原因是过去48小时用户请求量远超预期,算力集群已逼近承载极限,公司将优先保障存量用户服务。此前,智谱推出GLM Coding Plan时,也曾因阶段性算力资源紧张而限制套餐销售,部分开发者甚至需要“蹲点”购买,高峰时段还可能遭遇响应变慢或限流。

  这一现象,折射出一个新的产业现实:算力已经不再只是后台资源,而开始直接影响产品销售、用户体验乃至模型商业化进程。

  早在今年年初Token(词元)流行之时,Omdia行业分析师杨光曾向记者预计指出,过去行业更多关注模型排行榜、参数规模和Benchmark成绩,而未来企业真正需要竞争的指标将变成单位Token成本、推理吞吐能力、服务稳定性以及GPU利用效率。

  从国际市场来看,这种趋势同样越发明显。IDC预计,到2028年,全球AI相关支出将保持较高增速,其中生成式AI推理基础设施将成为未来几年增长最快的细分领域之一。与此同时,越来越多云厂商开始将投入重点从单纯采购AI芯片,转向打造能够支撑超大模型持续运行的系统级算力平台。

  也正是在这一背景下,超节点开始成为全球AI基础设施竞争的新焦点。

  超节点重塑AI竞争逻辑

  如果说大模型决定了AI的“智商”,那么超节点则开始决定AI能否真正跑进产业。

  所谓超节点,并不是简单增加更多AI芯片,而是通过高速互联网络,把数十甚至数百张AI芯片连接成一台逻辑上的“超级计算机”,让原本分散运行的算力资源能够像单台服务器一样协同工作。

  这一变化看似只是底层架构升级,却直接关系到超大模型能否实现稳定、高效、低成本运行。

  以此次阿里云上线的真武M890超节点实例为例,其由64张真武M890芯片组成,通过ICN Switch 1.0实现高速互联,整体显存规模超过9TB,芯片间互联带宽达到800GB/s,可支撑2万亿参数级MoE模型的专家并行推理需求。阿里云方面表示,通过算子优化以及芯片、云平台和模型的协同调优,在Agentic推理场景下,该超节点最高可实现1.5倍性能提升。

  在业内人士看来,这一提升并非来自单颗芯片算力的大幅跃升,而更多来自系统效率的改善。

  CHIP实验室主任罗国昭向记者介绍道,长期以来,GPU性能提升主要依赖芯片本身不断升级,但当模型规模进入万亿乃至数万亿参数时代后,真正拖慢计算速度的,越来越不是芯片,而是芯片之间的数据传输。

  例如,一个2万亿参数的MoE模型往往需要同时调用多个专家网络,每完成一步推理,都需要不同GPU之间频繁交换数据。如果互联带宽不足,大量GPU不得不停下来等待数据同步,即使理论算力充足,也难以真正发挥出来。这也是业内常说的“GPU不是在计算,而是在等待”。

  而超节点的价值,正是在于尽可能缩短这种等待时间。

  罗国昭表示,通过高速互联、更大的统一显存以及更加紧密的软硬件协同,超节点能够提高GPU利用率,把更多理论算力转化为实际可用算力,从而在保证推理速度的同时,降低单位Token的计算成本。这也是当前各家云厂商纷纷布局超节点的重要原因。

  事实上,这已经成为全球AI基础设施演进的共同方向。

  罗国昭举例道,英伟达推出GB200 NVL72,将72张Blackwell GPU连接在同一NVLink域内,配备13.4TB HBM3E显存,面向万亿参数模型训练和实时推理;谷歌则推出分别针对训练和推理优化的TPU 8t和TPU 8i,不再追求单一芯片性能,而是围绕不同AI场景重新设计整个计算系统。可以看到,国际头部厂商出售的早已不只是GPU,而是包含芯片、互联、液冷、网络、软件在内的一整套AI计算平台。

  这一趋势也意味着,AI基础设施竞争正从过去的“拼芯片”,进入“拼系统”的新阶段。

  对于国内厂商而言,超节点的意义不仅是突破某一个模型的部署能力,更在于构建完整的AI基础设施生态。

  据阿里云弹性计算产品线负责人吴结生介绍,阿里此次能够较快完成Qwen3.8与真武超节点的适配,很大程度上得益于其具备“芯片—互联—云平台—模型—应用”的全栈能力:平头哥提供真武M890芯片及互联能力,阿里云负责超节点和云基础设施,Qwen团队提供模型优化对象,百炼平台则进一步将模型能力封装为企业可直接调用的推理服务,实现了从底层硬件到上层应用的协同优化。

  不过,业内主流看法也普遍指出,超节点仍属于重资产投入,其商业价值最终还需要市场检验。

  一方面,随着Agent应用、AI Coding、智能办公、智能客服等场景快速增长,推理需求有望持续提升,为超节点带来更高的设备利用率;另一方面,如果市场需求增长不及预期,大规模基础设施投入也可能形成折旧压力,而如果需求增长过快,扩容速度跟不上,又可能出现算力紧张、服务限流等问题。如何在资本开支、设备利用率和Token收入之间取得平衡,将成为云厂商未来竞争的重要课题。

  可以预见,随着大模型参数规模不断迈向新的数量级,行业竞争的胜负手将更多取决于谁能够以更低成本、更高效率、更稳定的方式把这些模型持续送达用户手中。从这个意义上说,阿里云此次跑通2.4万亿参数Qwen3.8,既是一次基础设施能力的验证,也折射出AI产业竞争逻辑正在发生深刻变化——大模型时代的下半场,竞争的不只是模型本身,更是一整套AI基础设施体系的综合实力。

郑重声明:用户在财富号/股吧/博客等社区发表的所有信息(包括但不限于文字、视频、音频、数据及图表)仅代表个人观点,与本网站立场无关,不对您构成任何投资建议,据此操作风险自担。请勿相信代客理财、免费荐股和炒股培训等宣传内容,远离非法证券活动。请勿添加发言用户的手机号码、公众号、微博、微信及QQ等信息,谨防上当受骗!
作者:您目前是匿名发表   登录 | 5秒注册 作者:,欢迎留言 退出发表新主题
温馨提示: 1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。《东方财富社区管理规定》

扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500