AI算力竞争进入“系统战”:华为发布昇腾960超节点,产业链重心正在转移
2026年9月20日 15:39
人工智能产业的竞争,正在从单颗芯片的参数比拼,转向计算、互联、存储和软件生态协同的系统能力。9月17日至19日,华为全联接大会2026在上海举行。会上,华为围绕“超节点+集群”发布多项AI基础设施进展,其中包括采用近封装光学技术(NPO)的昇腾960超节点、升级后的鲲鹏超节点,以及面向大规模推理场景的OceanStor M900 AI记忆存储系统。这批发布传递出一个清晰信号:当大模型走向万亿级参数和智能体规模化应用,决定算力效率的已不只是芯片本身,而是整个系统能否高效协同。
为什么“超节点”会成为本轮产业关注的焦点?传统AI集群通常由大量服务器连接而成,规模扩大后,节点之间的数据传输、协议转换和故障管理会吞噬越来越多的有效算力。超节点通过高速互联和统一内存编址,让多个计算节点在逻辑上更接近“一台计算机”,从而降低通信开销。华为披露,目前昇腾910C超节点已部署超过1000套,昇腾950超节点已进入规模商用。按其内部仿真数据,由4K超节点组成的10万卡集群,相比传统8卡服务器组成的同规模集群,模型浮点算力利用率可提升2.75倍。需要说明的是,这一结果来自厂商披露,实际表现仍取决于模型类型、网络拓扑和软件优化水平。
此次发布的昇腾960超节点,把系统级竞争进一步推向光互联。根据华为公布的信息,单个超节点可容纳4096张加速卡,提供8 EFLOPS FP8算力和1PB HBM容量;系统使用5500个Hi-ONE NPO光互联器件,替代原方案中约4.8万个800G光模块,预计可降低超过550千瓦功耗,系统可用度达到99.8%。在芯片路线图方面,华为称昇腾960DT计划于2027年第一季度就绪,960PR计划于2027年第三季度就绪,并计划在2028年、2029年继续推出昇腾970和980。由此看,这次亮相既是产品发布,也是面向未来三年的技术路线预告。
算力系统的另一处变化发生在存储和通算侧。智能体需要频繁调用知识库、工具与上下文,推理过程会产生大规模KV缓存,仅靠增加AI加速卡并不能解决端到端效率问题。华为此次升级鲲鹏超节点,提出最大支持4096个节点和256TB统一内存池;同时通过灵衢UnifiedBus统一连接昇腾超节点、鲲鹏超节点和KV缓存集群,规划构建最高可扩展至百万卡的超节点集群。OceanStor M900 AI记忆存储系统也由此被放入同一套架构中,承担大规模推理中的上下文和缓存数据供给。
软件生态同样是超大规模算力能否落地的关键。华为披露,鲲鹏全球开发者已超过416万,CANN外部开发者占比达到61%,基于昇腾和CANN进行原生训练的模型超过40个;昇腾目前已覆盖PyTorch、Triton、vLLM、veRL等90多个主流第三方社区,并成为PyTorch官网支持的可安装算力平台之一。对于开发者和企业客户而言,硬件性能之外,模型迁移成本、工具链成熟度和社区兼容性,仍将直接影响技术选型。
从产业链角度看,AI基础设施正在形成新的价值分配逻辑。芯片仍是核心,但高速光互联、HBM、服务器液冷、高密度供电、AI存储、网络协议和集群调度的重要性同步上升。训练端追求更大的集群规模,推理端则更强调低时延、能效与持续运行能力,这会推动算力建设从“采购更多加速卡”转向“优化每一瓦电、每一跳网络和每一份存储”。对于上游厂商,机会将从单一器件扩展到系统解决方案;对于应用企业,评估AI基础设施时也需要把总拥有成本、可用度、生态兼容和扩展能力纳入同一张清单。
不过,超节点并不意味着规模越大越好。百万卡集群仍属于规划中的能力上限,其建设成本、能耗、运维复杂度和真实利用率都需要在实际部署中检验。不同企业的模型规模和业务负载差异明显,中小规模推理、边缘智能和端侧AI未必需要追求最大集群。未来一段时间,行业竞争的关键不是谁先报出更大的数字,而是谁能让计算、网络、存储和软件形成稳定、可复制、可持续的生产系统。AI算力由“芯片竞赛”转向“系统战”,或将成为下一阶段产业升级的主线。