从基建范式到集群架构,从硬件系统到软件生态,华为近期密集发布的全栈能力升级,勾勒出国产算力基础设施代际跃迁的完整图景。在AI算力需求指数级膨胀、全球供应链不确定性犹存的背景下,这场“升维”不仅是技术命题,更是一场关乎产业格局的深层变革。
基建升维 数据中心从平面走向立体
算力需求的爆发,首先冲击的是数据中心的物理形态。
9月15日,华为在安徽芜湖发布了全球首个3D数据中心,从分层解耦、立体堆叠的架构创新,到工厂预制、现场装配的建造革新,这座数据中心通过架构与建造方式的双重“升维”,将整体建设周期较行业常规水平缩短一半。
“2026年人工智能技术的发展‘周新月异’,10万亿参数将成为SOTA模型(当前性能最优模型)的基础规模。中国Token日均消耗从2024年初的千亿级增长到2026年约500万亿,增长近5000倍。”华为副董事长、轮值董事长汪涛表示,10万卡以上的昇腾超节点集群在2027年将成为基础配置。
需求井喷的另一面,是传统基建模式的失速。AI时代高密算力让机柜功率从风冷时代的几千瓦急剧攀升至100千瓦甚至200千瓦,而传统数据中心“土建先行、机电后置”的模式,却让机电交付周期长达6至8个月——算力设备到位了,机房却还在图纸上,“算力等机房”的痛点长期困扰行业。
对此,华为借鉴芯片工厂“动力层”与“生产层”分离的理念,把传统数据中心水平铺开的供冷层、IT设备层、供电层垂直叠加,电池系统部署于屋顶,形成立体堆叠的3D数据中心。在这一架构下,水、电与IT设备严格分层解耦,单点故障不蔓延;IT设备置于中间层,液冷精准带走热量;液冷管道与供电线路楼层间垂直互通,路径最短、损耗最小;高速交换网络部署于IT层几何中心,单栋楼宇可支撑168兆瓦功率、10万卡集群部署,堪称“超级算力工厂”。
更具产业意义的是建造模式的转变。华为高级副总裁、常务监事任树录介绍,3D数据中心采用“乐高式”模块化设计,核心模块在工厂完成组装测试,现场只做装配连接,机电预制化率超过90%,复杂的现场施工变成标准化“积木搭建”。华为先在贵安完成三层架构样板验证,随后芜湖项目从打桩开工到交付全流程历时仅9个月。
这意味着什么?从投资视角看,机电交付周期减半、底层机电可沿用10年以上,而算力设备每1至2年快速迭代,算力资产的折旧模型与投资回报周期正在被改写。华为云CEO周跃峰透露,华为云已在贵州贵安、内蒙古和林格尔、安徽芜湖部署了三大云核心枢纽,均规模化建设3D数据中心,支持智能算力的快速增长和规模化部署的需求。
值得注意的是,华为将《3D数据中心概要设计图库》向全社会开放,并发行《3D数据中心》专著。标准化、产品化的建设模式,正在牵引供电、制冷、储能、智能运维等上下游环节协同升级。基建环节的“升维”,本质是把数据中心从定制工程变成可复制、可规模化的标准产品,这为后续全产业链的成本下行打开了空间。
架构升维 算力底座开启系统级创新
9月17日,华为全联接大会2026在上海世博中心启幕。会上,汪涛发布了业界首个采用NPO(近封装光学)技术的昇腾960超节点,可用于匹配10万亿参数模型训练和推理的需求。
如果说3D数据中心解决的是“算力工厂如何建得更好”,那么超节点解决的则是“算力如何更澎湃”。
在传统计算架构下,集群规模扩大时资源利用率反而下降——10万卡集群的实际模型算力利用率(MFU)仅约20%,大量算力处于等待通信完成的状态。华为马尔科夫实验室仿真结果显示,由4K超节点组成的10万卡集群,相比8卡服务器组成的同规模集群,MFU可提升2.75倍。正因如此,超节点已成为建设超大规模AI基础设施的必然选择。截至目前,昇腾910C超节点已部署超1000套,昇腾950超节点也已规模商用。
此次发布的昇腾960超节点,是业界首个采用NPO技术的超节点。华为将多年积累的光技术引入超节点系统,推出全球首个量产NPO光引擎Hi-ONE,单引擎传输容量达7.2T,是目前行业最大传输能力、唯一实现内置光源的NPO产品。
汪涛介绍,基于“灵衢+Hi-ONE”打造的昇腾960超节点,采用正交架构和全液冷设计,依托灵衢协议实现内存统一编址,可扩展至4096卡规模,提供8E FP8算力和1PB HBM容量。一组数字直观呈现了其降本能力:该超节点用5500个Hi-ONE模块,替代原本需要的4.8万颗800G光模块,功耗降低超550千瓦,系统无故障运行时间提升一倍,可用度达99.8%。同时,华为已在国际标准组织OIF(光互联论坛)提出NPO标准立项建议,推动完善产业生态。
算力系统还在向“超节点集群”演进。随着SOTA模型参数规模达到10万亿级,匹配训练和推理需求的算力系统不再是单一的AI服务器或超节点,而是一个包括智算超节点、通算超节点、互联系统和PB级KV缓存集群的复杂算力系统。
对此,华为将超节点架构引入通算系统,全新升级鲲鹏超节点,基于灵衢全光组网,最大支持4096节点,形成256TB统一内存池,可实现Agent更高密的沙箱、更快的沙箱启动速度和更好的Agent向量检索性能。同时,华为发布了基于灵衢UnifiedBus总线、支持“一跳直连”的L3.5层PB级KV缓存解决方案OceanStor M900集群。
而多个昇腾960超节点,采用灵衢网络或RoCE连接在一起,即可构建更大规模的超节点集群,通过二层CLOS四平面组网,最大集群规模可达到51.2万卡,再结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群,足以支撑模型参数向几十万亿演进。
其中,最值得关注的是灵衢互联架构。华为常务董事、ICT BG CEO杨超斌在大会上阐释了灵衢互联架构的设计理念:将十余种互联协议统一为灵衢协议,互联带宽从百GB级提升至TB级,RTT通信时延从7微秒压缩至2微秒,支持超节点内全局内存统一编址,CPU、NPU、内存、SSD通过灵衢直接互联,实现去中心化平等访问和算力异构协同。
基于此,华为发布了覆盖柜内、跨柜与集群三级互联的灵衢互联设备:柜内互联刀片实现零电缆,一个4096超节点可节省196公里铜缆;跨柜设备单机280T全光互联;UBG交换机具备1024超大Radix扇出能力,可支撑百万卡超节点集群。
在芯片层面,昇腾960芯片研发进度同样超出预期。汪涛透露,昇腾960风冷超节点和液冷超节点分别将于明年第二和第三季度陆续上市。未来,昇腾系列坚持一年一代,2028年、2029年将陆续推出970、980芯片,实现算力规格持续翻倍。
从机柜到楼宇,从超节点到集群,从芯片到互联协议,一条清晰的脉络是:国产算力的竞争力,正从单点硬件参数转向“系统级架构创新”。
“华为将坚持系统级创新,构筑系列化算力底座,开源开放,联合客户、伙伴和开发者共建生态,为世界提供新选择。”杨超斌表示。
生态升维 从“可用”走向“易用”
硬核技术之外,另一场更深刻的变革发生在生态层。
汪涛在大会上透露,CANN(神经网络异构计算架构)作为昇腾生态根基,已进入常态化开源社区运营阶段,开始从“可用”走向“易用”。当前,CANN社区中外部开发者占比首次超过内部开发者,达到61%,社区月活开发者数量突破5200名,是国内最活跃的开源社区之一。基于昇腾+CANN的原生训练模型数量也已超过40个,是国内唯一完整支持大模型预训练的技术路线。另外,昇腾已覆盖PyTorch、Triton、vLLM、veRL等90多个主流开源社区,并正式成为PyTorch官网可直接安装的算力平台,这也是首个登上PyTorch官方安装列表的中国算力平台。
鲲鹏生态同样可观:全球开发者超416万,生态合作伙伴超7200家,支持560多个全球开源项目,开源欧拉装机量超2000万套,市场份额稳居中国服务器操作系统第一。昇腾还与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同,开发了智能管理、推理加速、安全框架等Agent插件化组件并全量开源;联合50多家客户、伙伴及高校打造了26个行业算子库。
生态拐点的意义,不亚于硬件突破。长期以来,国产算力面对的核心挑战,并非单颗芯片的性能差距,而是开发者生态与软件工具的积累。当外部开发者占比过半、主流框架原生支持、行业算子库批量落地,意味着国产算力正在跨过“生态临界点”,正式从“能不能用”的替代逻辑,转向“好不好用”的竞争逻辑。
业内人士认为,华为近期的一系列动作,共同指向一个判断:算力产业竞争正从芯片、服务器、数据中心这些单一产品,升级为“架构+基建+生态”的全栈体系。算力已被纳入国家“六张网”战略部署。在此背景下,国产算力的全栈“升维”,既是企业层面的技术路线图,也是国家算力布局的微观落地。正如汪涛所言,没有任何一家公司能独自支撑整个智能世界。国产算力能否在AI时代构筑起可持续的产业竞争力,答案将在未来两到三年的规模化商用中渐次揭晓。
(责任编辑:黄春棉)