国产 AI 算力加速卡份额突破四成:昇腾、寒武纪、摩尔线程的“系统战”已经打响

近半年,国产 AI 算力芯片领域最显著的变化,是市场份额从”备胎”位置开始真正进入到主流的采购名单。综合 IDC、TrendForce、Bernstein 等机构最新披露的数据,2025 年中国 AI 加速卡出货约 400 万张,其中国产芯片 165 万张,份额已经超过 41%。而这还只是 2025 年全年的数字,进入 2026 年,国产替代的曲线进一步陡峭化:TrendForce 与 Bernstein 在今年 8 月的最新预测中,将 2026 年国产高端 AI 加速器在国内市场的占比从此前的约 50% 上调到接近 90%,相应地,英伟达在中国的份额从 2025 年的约 40% 跌向 8% 左右。

国产 AI 算力加速卡份额突破四成:昇腾、寒武纪、摩尔线程的“系统战”已经打响

梯队格局:一超、多强、新势力

当下国产 AI 芯片厂商的竞争格局,可以概括为”一超、多强、新势力”三档。位于”一超”位置的是华为昇腾。综合多家券商研报的数据,2025 年昇腾芯片出货约 81.2 万张,占国产总出货量的约 49.2%。从产品节奏看,昇腾在 2026 年第一季度推出面向推理 Prefill 阶段和推荐业务的昇腾 950PR,单卡 FP8 算力达到 1 PFLOPS、FP4 算力达到 2 PFLOPS;2026 年第四季度则会推出面向推理 Decode 阶段和训练场景的昇腾 950DT,配套的是在 WAIC 2026 首次亮相的 Atlas 950 SuperPoD 超节点,最多可支持 8192 张昇腾 950DT 高速互联,提供 1 EFLOPS 的 FP8 算力。

“多强”梯队由寒武纪、海光信息、平头哥、昆仑芯、燧原、沐曦、芯瞳等组成。寒武纪上半年营收 59.96 亿元、净利润 23.11 亿元,进入兑现期;海光信息走”CPU+DCU”双芯融合路线,深算三号已适配 365 款主流大模型;阿里平头哥的真武 M890 已在阿里云多个万卡集群内部署,单芯片液冷散热功率可达 2kW。

“新势力”梯队则以摩尔线程、沐曦股份、壁仞科技、燧原科技、中昊芯英、芯瞳半导体、格兰菲等为代表。摩尔线程 S70、S80、S5000 等数据中心级产品已经形成梯队,AI Cubes 智算一体机面向推理场景的中小算力需求;沐曦股份 H1 营收实现翻倍,燧原科技科创板 IPO 已过会,昆仑芯启动了 A+H 两地上市进程。这条赛道从”一个人的战斗”变成了”组团作战”。

国产 AI 算力加速卡份额突破四成:昇腾、寒武纪、摩尔线程的“系统战”已经打响

从单卡到超节点:系统战的开端

如果只是把”一超多强”的故事讲到这里,那还停留在单卡算力的比拼。但实际上,从 2025 年开始,国产 AI 算力真正的分水岭,已经转向了”超节点”这一形态。所谓超节点,本质上是用高速互联把成百上千颗芯片耦合为一套系统,以系统级能力弥补单卡在先进制程、HBM、CoWoS 封装上的劣势。

华为在 WAIC 2026 公开的昇腾 950 超节点是这一方向的代表。Atlas 950 SuperPoD 一个计算柜可配置 64 张昇腾卡,满配由 16 个计算柜和 4 个互联柜组成,可实现 1024 张 NPU 高速互联,256TB 全局统一虚拟地址空间,1 EFLOPS FP8 算力,3 微秒 RTT 超低时延。配合华为自研的灵衢统一互联协议,柜内与跨机柜 NPU 实现了全互联,对外宣称的训练性能较上一代 Atlas 900 提升约 17 倍。商用层面,昇腾 384 超节点已累计规模商用超过 750 套;中国移动 2026 年 6 月高性能服务器集采总规模约 776 套计算节点,昇腾超节点是核心中标方案之一。

<

国产 AI 算力加速卡份额突破四成:昇腾、寒武纪、摩尔线程的“系统战”已经打响

p>与华为几乎同时,阿里平头哥在 WAIC 2026 展出的真武 M890 搭配磐久 AL128 超节点,真武 M890 内置 144GB 显存,片间互联带宽达 800GB/s,整机采用定制双宽机柜,单机柜可搭载 128 至 144 颗 GPU 芯片。寒武纪思元 690 则是国产推理芯片的代表,深度绑定头部互联网客户,传闻订单量级在 60 万颗以上。

软件生态:从”可用”走向”好用”

硬件之外,软件生态是国产 AI 芯片能否真正进入生产系统的关键。在过去相当长时间里,CUDA 生态是横在国产芯片面前的一道高墙,但情况正在发生变化。一方面,主流大模型开始主动适配国产芯片。DeepSeek-V4 实现了对 9 款国产 AI 加速卡的 Day0 适配;智谱 GLM-5.3-Flash 已经在实际流量中通过国产芯片集群对外提供服务,其单 token 成本已经与主流英伟达 GPU 相当。另一方面,国产芯片厂商也主动把软件栈开源开放。华为 CANN 已全面开源,灵衢协议及五大软件组件同步开源;摩尔线程围绕 MUSA 架构也已经构建起比较完整的工具链。

在生态合作的层面,运营商和国资智算中心是国产算力”从送样走向规模出货”最重要的推手。2026 年 6 月,中国电信高性能服务器集采总规模接近 115 亿元,4 万台高性能服务器 100% 国产化,其中 ARM 架构鲲鹏生态拿下约 81.61 亿元;2026 年 7 月,中国移动 2026—2027 年 PC 服务器集采 ARM 架构服务器采购量 40896 台,占比 65.01%,创下国内运营商单批次集采 ARM 架构占比的最高纪录。

量产后还要看 ROI

把多家机构的数据横向放在一起看,2026 年国产 AI 算力的核心变化,并不是某一颗芯片的算力数字突然追上了英伟达,而是体系层面的成熟度进入了量产兑现期。具体表现为三点:一是运营商、国资智算中心这类大体量客户开始常态化集采国产芯片;二是超节点形态成为头部厂商的共同选择,单卡差距被系统能力补回;三是软件栈从”能跑”过渡到”常用”,主流大模型的 Day0 适配让国产算力首次具备承载真实流量的能力。

当然,国产算力仍然面临现实挑战。先进制程、HBM、CoWoS 先进封装的供给卡点预计要到 2027 年起才有望缓解;单卡绝对算力与英伟达最新旗舰相比仍有差距;部分细分赛道的软件生态成熟度还有待时间检验。但从份额数据、订单数据和生态合作的进展看,”国产加速卡份额突破四成”并不是一个孤立数字,而是国产 AI 算力从”可用”走向”好用”的起点。接下来的看点,是超节点的规模商用能否真正在头部客户的实际生产场景中跑出可量化的 ROI。