
智东西9月19日报道,在9月17日‑19日举办的2026年全联接大会上,华为围绕灵衢互联架构及超节点集群,推出昇腾960芯片、昇腾960超节点、OceanStor M900 AI记忆存储等一系列AI基础设施新品,引起产业多方关注。
其中,“灵衢”成为贯穿所有发布、高频出现的关键词,引起了很多人的好奇。
灵衢是什么?有什么过人之处?
华为常务董事、ICT BG CEO杨超斌在主题为“灵衢互联,架构创新,构建Agentic AI算力底座”的演讲中,给出了完整答案。
简单来说,灵衢(UnifiedBus),是华为整个算力底座的统一互联总线协议。它把CPU、NPU、DPU、DDR、SSD等多种计算与存储单元统一互联起来,并进一步贯穿单机、超节点和超大规模集群。

传统互联下,十万卡集群实际算力使用率只有约20%,难以扛住AI Agent时代的计算需求。华为公布的数据显示,基于灵衢的单集群可支持100万颗AI处理器,10万卡集群的模型浮点算力利用率(MFU)从20%提升至35%。
为什么华为把这次架构创新的关键点钉在“通信”上?
这要从AI Agent时代的计算需求变化说起。
一、通信成AI Agent算力胜负手,三大挑战“逼”出灵衢架构答案
AI Agent时代,通信正在成为算力“胜负手”。
现在,模型参数规模已经从万亿级走向10万亿级,未来可能进一步达到20万亿甚至50万亿;上下文长度也从几K级来到几M级,未来可能达到几十M。与此同时,人与Agent的交互频次也远高于模型。
作为AI底层的计算系统,需要同步支持超大模型推理、高频次调用、多种工具使用、多层级信息传递与存储,面临诸多挑战。

1、通信量平方级暴涨,10万卡MFU不足20%
第一个挑战来自通信范围极速变大。数据并行域内的通信量与参数量呈近似平方关系,不可掩盖的通信时间占比成倍增加,MFU快速下降。
典型MoE模型在10万卡集群上的MFU不到20%。如何打破MFU随集群规模快速下降的趋势,成为计算系统面临的第一道难关。
2、一种算力喂不饱所有AI负载,异构协同与内存池化成刚需
第二个挑战来自AI业务负载多样化。Prefill(预填充)与Decode(解码)呈现出不同的计算特征与访存特征,因此P、D分离,用不同算力来满足。
面向未来更大模型、更低时延的推理,Decode中的Attention与FFN,由于计算与访存特征差异,用专用算力来加速可以提升效率。
同时,随着Agent应用普及,CPU与NPU配比发生变化,计算系统需要异构算力协同、内存资源池化,实现动态、高效调整。
3、上下文持续变长,旧互联撑不起多级缓存
第三个挑战是上下文持续变长带来的存储压力。无论是训练还是推理,都必须构建层次化的多级缓存架构,包括HBM、DDR、SSD分层分级,成为必然选择。
现有PCIe加RoCE网络,难以满足缓存所需要的时延与带宽需求。未来PB级的KV Cache,也需要更大的带宽、更低的时延来匹配。
可以说,通信,开始成为计算系统性能的关键。
它需要超强互联能力,支持异构算力高效协同和扩容;也需要打破物理极限,实现算力、内存等资源池化;还需要超大带宽和更低时延,保障计算系统的通信效率。
灵衢,就是华为针对这些变化给出的架构答案。
二、一套协议打通芯片到集群,灵衢四大竞争力重装算力底座
灵衢的核心,是用一套协议贯穿从芯片到集群的整个系统,把复杂协议归一,统一内存语义,消除协议转换开销。
杨超斌谈道,其竞争力可以概括为以下四个维度:
1、协议归一,统一内存语义。传统计算系统采用主从架构,服务器内部CPU和内存可以通过load/store指令直接访问,但跨节点访问通常依赖RDMA的Send/Receive消息传递。数据需要反复打包、拆包,还要进行协议转换。
灵衢要做的,就是从协议层重新组织这一过程。华为将CPU、NPU、DPU、内存、存储、网卡等核心组件统一基于灵衢协议互联,实现十几种协议归一;同时在超节点内部统一内存语义,实现全局内存统一编址。由此,其互联带宽从百GB级提升到TB级,RTT通信时延从7微秒压缩至2微秒,降低约70%。

2、多样算力,异构协同。CPU、NPU、内存和SSD等计算、存储单元通过灵衢直接对等互联,形成去中心化的平等访问方式。这样一来,计算系统可以根据不同业务需求灵活配比CPU和NPU,同时具备可扩展性,而不必受制于固定的节点结构。
3、分级存储,全局池化。随着AI模型不断变大,单颗芯片、单台服务器能够提供的内存容量越来越难满足需求。灵衢通过分级存储和全局池化,将多种混合介质纳入统一资源体系,提高内存利用率。
4、光电互联,灵活组网。当超节点从千卡走向万卡,电互联开始受到物理距离、带宽和功耗等限制。华为通过光电互联构建超高带宽、超低时延的“数据高速公路”,让算力能够从柜内向跨柜延伸。

以4096卡超节点为例,其需要56个计算柜和14个灵衢互联柜,灵衢最长传输距离超过200米。华为通过光路保护、高速光互联以及176端口、280Tb高速互联的灵衢交换设备,把单个超节点规模从1024卡扩展到4096卡。
进一步向Scale-Out扩展,4096卡超节点可以作为基本扩展单元,通过1024超大Radix扇出能力、两层CLOS以及多平面、多轨道拓扑,最终让单个集群支持100万颗AI处理器。
一位产业链人士告诉智东西,过去几年行业多在既有PCIe加RoCE体系上做优化,但Agent负载把通信、内存、存储的短板同时放大,继续在旧协议上叠补丁,收益会越来越小。
灵衢等于给AI Agent重装算力底层逻辑,满足多样化算力需求。
三、从单柜到百万卡,从超节点到一体机,满足各类Agent需求
基于灵衢,华为进一步构建了一套光电互联、多样算力、分级池化的AI Agent超节点集群。计算、存储、联接产品全面支持灵衢,模块化设计,灵活配置。

1、支撑超节点“全家桶”,昇腾960提前登场,狂卷计算效率
会上新发布的Agentic AI超节点集群由鲲鹏950超节点、昇腾960超节点、OceanStor M900记忆存储、星河UBG交换机组成。整个超节点集群,可以实现灵衢统一协议、多样化算力灵活扩展、资源分级池化,让计算效率最优。
其中,基于灵衢+NPO光引擎Hi-ONE,单个昇腾960超节点可实现4096卡规模,最大可提供8 EFLOPS FP8的算力,实现高达1PB的HBM容量,系统无故障运行的时间提升1倍,系统可用度可以达到99.8%。昇腾960风冷超节点和液冷超节点分别将于2027年Q2和Q3上市。

2、从单柜172T到百万卡:灵衢一统,分层按需弹性扩展
在Scale-Up方向,柜内灵衢交换刀片支持172T超大带宽,可实现72个昇腾处理器和18个鲲鹏处理器互联。华为还通过光互联减少柜内电缆,一个4096超节点内单柜可节省196公里铜缆,超过上海到杭州的距离。

跨柜后,灵衢交换设备拥有176个端口,每个端口达到1.6T,单机实现280T全光互联。两层CLOS组网可以构建4096卡超节点,RTT时延低至2微秒。
再向Scale-Out扩展,UBG灵衢网络交换机拥有1024超大Radix扇出能力,可支持百万卡超节点集群,支持模型参数向几十万亿演进。
由此,灵衢形成了一套从单柜、千卡、万卡到百万卡的分层分级互联体系,并能够按需弹性扩展。
3、算力存储三件套,灵衢融合出1+1+1>3
再看算力与存储,鲲鹏950超节点的计算刀片提供384个CPU核和6TB内存。单柜可提供12288个CPU核,支持192TB内存。基于灵衢,鲲鹏超节点可以实现超过150万核统一调度,以及24000TB内存全局池化、统一编址和统一访问。

昇腾960超节点计算刀片则支持8颗昇腾960 NPU,提供32 PFLOPS FP4算力、4.5TB统一内存,以及17.9TB/s灵衢互联带宽。
OceanStor M900则负责记忆存储。它通过全新的存储控制器和ASU模组,实现网络、CPU、盘控芯片“三芯合一”,单ASU模组拥有64TB容量密度,单节点访问带宽达到480GB/s。

三类硬件通过灵衢统一协议进行灵活配置,实现联动协同和全局访问。华为将这种融合效果概括为“1+1+1>3”。
4、灵衢下沉一体机:Atlas 650E双机直连,本地跑万亿模型
而在更大规模集群之外,中小场景同样在灵衢覆盖范围内。
大部分企业实际部署仍然需要风冷和轻量化方案,桌面级AI应用也在快速普及。因此,华为基于灵衢推出从1卡到8卡的系列化、多层级一体机产品和鲲鹏昇腾模组。

Atlas 650E可以通过双机灵衢直连,让16个NPU进行Full-Mesh组网,无需交换机。两台机器可以像一台一样运行,支持万亿参数模型,并通过EP16并行切分让推理吞吐提升40%以上,时延低至10毫秒,让中小企业也能在本地运行万亿参数大模型,同时保障用户体验和数据安全。

未来增加到16卡以上,其还可以继续通过灵衢互联进行平滑扩容,形成小型超节点,同时支持PD分离部署,实现异构AI算力的高效协同。
总的来说,大场景有百万卡集群,中小场景有一体机,华为要把“灵活算力”打成产业刚需。
四、开源组件加行业算子库,让生态伙伴“开箱即用”
灵衢要成为底座,不能只靠硬件。
杨超斌在演讲中回顾,去年8月5日,华为CANN全面开源开放,至今已跃升为中国开源项目活跃度第一。
目前CANN社区月活开发者已经达到5200多人,来自企业、高校等不同群体的开发者持续参与。50多家行业头部客户、伙伴及高校科研团队与昇腾合作,将行业知识和业务经验融入昇腾,已经打造26个行业专属算子库。

华为与南方电网、高校及其他伙伴一起,在社区中构建起电力仿真求解、电力负荷预测、电力装备巡检等一系列专属开源算子库,让输电线路巡检更加精准,让电网负荷预测更加高效,真正让AI落地到电力生产一线。
科大讯飞深耕AI大模型与应用技术创新,基于昇腾打造领先AI模型,开发了智能客服、办公等通用方案,金融、教育、医疗等行业场景化方案,为客户提供高质量AI解决方案。

另一侧,则是Agent开发生态。华为正在与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同,打造智能管理系统、推理加速库、安全框架等Agent插件化组件,并进行全量开源。
为了进一步降低开发和部署门槛,华为还与90多家主流开源社区展开合作,覆盖算子编程、基础库搭建、模型训练微调、推理部署和强化学习等全链路场景。

可以看到,华为希望最终实现的,是“开箱即用”。这也是所谓“硅基黑土地”战略的核心逻辑。
结语:算力底座之争,华为给出“系统级加开放生态”新选择
AI时代奔涌而来,算力是这场变革的核心基石。杨超斌在演讲结尾表示,未来华为将坚持系统级技术创新,面向各行各业,构筑系列化算力底座;坚持开源开放、联合客户、伙伴和开发者,共建生态,为世界提供新的选择。
从灵衢打破通信墙,到11颗关键芯片撑起超节点,再到百万卡集群与开源生态跨越拐点,华为正以“计算加通信”的垂直整合能力,为10万亿级大模型时代构筑算力底座。
当算力供给从“硬件变现”走向“生态共赢”,AI基础设施竞争已升维为体系化能力较量。华为的硅基黑土地,正试图为智能世界提供另一种坚实选择。