7月19日,天数智芯(9903.HK)正式发布新一代通用GPU旗舰产品——天垓300,其基于SIMT通用计算架构,可高效支持标量、矢量和张量等多种计算类型,并围绕Attention、MoE、AF分离、PD分离及大规模系统扩展等关键技术进行了优化。
天数智芯AI与加速计算负责人单天逸表示,人工智能正从理解与生成信息的“信息智能”,迈向具备规划和执行能力的“行动智能”,并进一步拓展至能够建模、预测和探索未知的“探索智能”,这三类智能对计算提出不同要求,也构成了天垓300的产品设计主线。
在信息智能方面,针对大模型计算中的核心环节,天垓300重点优化了Attention与MoE。在上下文64k的场景中,天垓300的Attention效能高于Hopper方案10%。
针对MoE架构中的专家调度和数据路由损耗,天垓300通过算法与硬件协同优化,提高专家与计算单元利用率。在DeepSeek V4 MoE场景中的计算效率突破70%,综合训练效能和性价比优于Hopper方案。在推理场景中,可在保持相同响应体验的情况下承载更多并发请求,以相同算力投入完成更多推理任务,平均效能高于Hopper方案10%。
在行动智能方面,天垓300强化PD分离(Prefill/Decode分离)能力,分别针对上下文处理的Prefill阶段和逐Token生成的Decode阶段进行差异化优化,让Agent既能想得快,也能做得快。
有关的Qwen、GLM、Kimi、DeepSeek等主流模型测试显示,天垓300首字延迟较Hopper架构主流方案降低约20%。针对Decode阶段高频、多卡、小数据量通信,产品通过降低协议开销、优化链路路径和数据流转机制,使平均通信延迟降低约13%。
在探索智能方面,天垓300回归计算本质,不局限于Transformer架构,可高效支持标量、矢量和张量计算,覆盖FP4、FP8等多种精度及MMA、DPX、FMA等指令。除Attention、FFN和MoE外,还可适配矩阵求解、动态规划、稀疏计算和数字孪生等任务,为现有算法优化和未来计算范式演进预留空间。在Cosmos3世界模型中,天垓300的推理效能相较Hopper方案同样高出10%。
记者了解到,目前天垓300已具备规模化应用条件,并与国内云厂商、服务器厂商、互联生态及超节点系统开展深度适配,可支持从单机到规模化集群的规模化部署。
2026世界人工智能大会(WAIC 2026)期间,天数智芯携天垓、智铠、彤央三大通用GPU产品系列参展,集中展示其在互联网、金融、工业、交通、气象、能源、医疗、电力、政务及Token出海等领域的应用实践。截至去年年底,天数智芯已服务30余个行业的340余家客户,集群稳定运行超过1000天,在线运行规模超过万卡。