9 月 17 日,华为全联接大会 2026 在上海开幕。整场发布会信息量最大的一段,是华为副董事长、轮值董事长汪涛发布的昇腾 960 超节点——官方称这是业界首个采用 NPO 技术的超节点产品。
如果只记住一个数字,那就是 4096。一个超节点里塞进 4096 张加速卡,并且让它们像一台计算机那样共享内存、协同工作。这个规模目前是业界最大的一档。
NPO 是什么,为什么这次主角是光引擎
先解释三个缩写,后面的内容才看得下去。
超节点是一种把大量计算节点用高速互联紧密捆起来的系统。关键在于「共享统一内存」——普通集群里,卡和卡之间通信要经过网络协议一层层封装,开销很大;超节点把这些开销压下去,让 4096 张卡在软件看来接近一台机器。
NPO 全称 Near-Packaged Optics,近封装光学。传统方案里,芯片和光模块之间隔着一段铜线或电路板走线,信号要跑一段距离才能变成光。NPO 把光引擎挪到芯片封装旁边,缩短这段距离,能同时拿到更高带宽和更低功耗。
主角产品是 Hi-ONE,华为自研的光引擎,官方给出的单引擎传输容量是 7.2T。华为强调它是业界首个具备量产能力的 NPO 产品,也是目前唯一实现内置光源的 NPO 产品。内置光源这个点听上去不起眼,但它意味着外部不需要再单独配光源模块,整机结构能简化不少。
一个超节点 4096 卡,这笔账怎么算
把昇腾 960 超节点的规格摆在一起看:单节点最大 4096 卡规模,可提供 8 EFLOPS FP8 算力,FP4 精度下翻倍到 16 EFLOPS;HBM 容量最高 1PB。华为在另一份材料里提到,4096 卡之间的 RTT 时延低至 2 微秒。
微秒级的时延为什么重要?因为大规模训练里最贵的不是算力本身,而是等。一张卡算完之后要把梯度发给其他 4095 张卡,如果这个往返要花几十微秒,算得越快反而浪费得越多。厂商现在拼命追求「模型浮点算力利用率(MFU)」,本质就是在压缩这部分等待时间。
架构上,昇腾 960 超节点采用正交架构加全液冷设计,基于灵衢(UnifiedBus)实现内存统一编址。正交架构的好处是互联路径短、布线规整,全液冷则是 4096 卡这种密度下的必然选择——风冷已经压不住单柜的热流密度了。
5500 个光引擎,换掉 4.8 万个光模块
这组数字是整场发布会最有冲击力的一段。
按华为的说法,在昇腾 960 超节点里,用 5500 个 Hi-ONE 就能替代原本需要的 4.8 万颗 800G 光模块。换算下来是接近 9 比 1 的替换比。带来两个直接结果:功耗降低超过 550 千瓦,系统无故障运行时间提升一倍,系统可用度达到 99.8%。
550 千瓦是什么概念?一个中等规模的数据中心机房里,制冷系统往往也就这个量级的功耗预算。省下来的电不只是电费,还意味着同样的供电条件下可以多插算力。而「无故障运行时间翻倍」对大模型训练更关键——千卡以上规模的训练任务一旦中断,回滚检查点、重新排程的开销是小时级的,几千张卡的集群停机几小时就是一笔实打实的成本。
光模块数量减少 88% 还带来一个隐性收益:故障点变少了。光模块是数据中心里故障率偏高的部件之一,数量降一个数量级,运维压力跟着降。
从 51.2 万卡到 100 万卡,集群怎么往上堆
单个超节点上限是 4096 卡,往上的路怎么走,华为给了两级方案。
多个昇腾 960 超节点通过灵衢网络或 RoCE 连接起来,再配合二层 CLOS 四平面组网,最大集群规模可以做到 51.2 万卡。在这个基础上再加多轨道拓扑技术,最大可支持 100 万卡的昇腾超节点集群。
百万卡这个数字的意义在于模型规模。华为的表述是「支撑十万亿参数级大模型的大规模训练与推理」。参数规模到 10T 这个量级,单靠几千张卡训练一轮的时间已经长得不实用,集群规模本身就成了能不能做这件事的门槛。
顺带说一个配套动作:华为在全球光互联标准组织 OIF 提出了 NPO 标准的立项建议,并表示已得到多家行业伙伴响应。把自己的互联技术推进标准组织,通常意味着打算让生态里的其他厂商也能接上。
芯片路线图:970、980 与「一年一代」
量产节奏方面,华为给出的时间表比较具体:960DT 提前三个季度,2027 年第一季度就绪;960PR 提前一个季度,与 Atlas 960 液冷超节点一起计划在 2027 年第三季度推出。再往后,昇腾 970 定档 2028 年,昇腾 980 预计 2029 年上市。
「一年一代」是汪涛在会上反复强调的节奏。考虑到芯片从流片到量产要跨过多个季度,能维持这个节奏说明研发排期已经排到了三年后。已经落地的产品线也有数据:截至目前,昇腾 910C 超节点部署超过 1000 套,昇腾 950 超节点已规模商用。
不只是算力:鲲鹏超节点与存储配套
这场发布会的内容并不只有一颗芯片。华为同时把超节点架构搬到了通用计算上:全新升级的鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,形成 256TB 统一内存池。
在 Agent 场景下,官方给出的数据是十万级沙箱启动速度比传统服务器方案提升 30 倍,沙箱密度还能再提升 25%;在百亿千维向量检索场景里,检索效率也实现倍增。这两项指标指向的是同一个趋势——现在跑 AI 的不只是训练集群,推理侧对通用算力和内存池的需求正在快速上来。
存储侧推出了面向 Agent 推理系统的 OceanStor M900,基于灵衢 UnifiedBus 做到「一跳直连」的 L3.5 层 PB 级 KV 缓存,采用混合介质加优化 Retention 算法,官方称可将 SSD 读写寿命提升 16 倍。软件生态方面,CANN 已全面开源开放并进入常态化社区运营;鲲鹏全球开发者超过 416 万,生态伙伴超过 7200 家,openEuler 装机量超过 2000 万套。
把这一整套摆开看,华为这次画出的不是单个产品的升级曲线,而是从芯片、互联、系统到存储与软件栈的一整条链路。真正决定这条链路能不能跑通的,还是 2027 年那台机器能不能按时装上机架。


