首页 > 商业 > 正文

万亿参数模型挤压算力,超节点竞赛升温

2026-09-30 18:24:15 21世纪经济报道 21财经APP 孔海丽

21世纪经济报道记者 孔海丽

万亿参数模型放大了算力瓶颈,超节点是有效解决路径。

模型能否顺利运行,还取决于显存容量、互联带宽和通信时延情况。模型规模越大、上下文越长,芯片之间交换的数据越多,通信等待也越容易拖慢整套系统。

浪潮信息首席AI战略官刘军向21世纪经济报道记者表示,超节点需要解决的核心问题是怎样让大量芯片、显存和内存形成一个高效协作的计算域。在他看来,衡量超节点的指标应包括模型承载能力、通信效率和长时间运行的可靠性。

超节点竞赛升温

超节点已经成为AI基础设施厂商集中投入的方向。

英伟达的NVL72架构通过NVLink连接72颗GPU,使其在同一个高速计算域内协同工作。Vera Rubin NVL72采用全互联架构,每颗GPU可获得3TB/s的互联带宽。

华为CloudMatrix384则将384颗昇腾NPU和192颗鲲鹏CPU连接起来,通过全对等互联和资源池化支撑大模型推理。

AMD也在推进机架级AI系统,其Helios方案采用开放机架设计,并规划连接最多128颗GPU。UALink联盟发布的1.0标准则支持单个AI计算单元连接最多1024个加速器,阿里云、AMD、英特尔、Meta、微软等企业均参与其中。

这些方案的共同点,是通过高速互联扩大单个计算域。大型模型通常需要被拆分到多颗芯片上运行,芯片处理完一部分任务后,需要频繁交换模型权重、中间结果和KV Cache。互联速度跟不上,芯片便会花费大量时间等待数据。

智能体发展浪潮进一步增加了这一问题的复杂度。一次智能体任务可能包含规划、模型推理、工具调用、结果反馈和重新规划等环节,模型需要被反复调用。每轮增加几十毫秒,经过多次循环以后,用户感受到的等待时间就会被明显放大。

因此,超节点竞争同时考验芯片、内存、网络、散热、算子和软件调度等能力,单独增加芯片数量,无法保证模型性能按相同比例增长。

浪潮信息推出128芯超节点

近日,浪潮信息在2026人工智能计算大会上发布了元脑SD200 Ultra超节点AI服务器。该系统连接128颗本土AI芯片,提供8TB统一编址显存和64TB内存,主要面向万亿参数模型和复杂智能体任务。

超节点概念近年迅速升温,行业对其技术边界仍有分歧。刘军把统一寻址视为判断超节点的一项基本门槛。“它的显存要统一寻址,这个很重要。”他说。

统一寻址让分布在多颗芯片上的显存进入同一个逻辑地址空间,模型可以直接调用这些资源。SD200 Ultra由此将128芯本土AI芯片组织成一个紧耦合计算域,重点减少跨芯片访问过程中的数据搬移和通信等待。

据刘军介绍,这套系统的通信时延最低为0.69微秒,并通过对称内存技术,让GPU直接访问远端GPU显存。其内部测试显示,AllReduce通信时间缩短至原来的约三分之一。

这套系统在Kimi K3模型上的测试显示,SD200 Ultra可以在单个超节点内承载Kimi K3,Token生成时延最低为5.85毫秒,对应单用户每秒生成约170个Token。

Kimi K3拥有2.8万亿个总参数,每次推理激活1040亿个参数,上下文长度达到100万Token,是目前规模较大的开放权重模型之一。

浪潮信息还针对Kimi K3的模型结构进行了算子优化,将KDA、Gated MLA和MoE中的部分基础算子合并执行。公司称,算子数量减少约90%,Kimi K3在SD200 Ultra上的推理性能提升3倍以上。

规模之外还要算效率账

超节点的芯片数量在快速增加,节点规模却不能单独代表系统能力。

刘军认为,厂商首先要明确系统准备运行什么模型,再决定计算域的规模和架构。芯片数量增加以后,通信量、调度难度、功耗和故障点也会增加,模型从新增芯片中获得的性能收益,可能被通信等待和可靠性成本抵消。

这也是Scale-up架构面临的普遍难题。高速互联可以扩大单个计算域,但物理距离、交换芯片数量和链路复杂度仍会影响时延与稳定性。长时间运行的智能体任务对故障更加敏感,系统发生一次通信中断,可能影响整条任务链。

大模型公司往往也会根据任务选择算力。刘军将需求概括为两类:一类需要运行能力较强的前沿模型,用于科研、复杂决策和探索性任务;另一类追求稳定、低成本的Token供给,用于已经标准化的日常工作。

浪潮信息因此同时推出元脑SD200 Ultra超节点和元脑HC2000多元算力机组。前者承载前沿模型,后者针对大规模推理,将预填充、解码、Attention和FFN等负载分配给不同类型的算力。据刘军透露,HC2000在同等投资下可将Token产能提高10倍。

超节点给国产算力创新提供了一条系统级路径参考。单颗芯片的性能差距,可以通过扩大计算域、提高互联效率和优化软件栈等软硬协同创新进行部分弥补。系统厂商也要承担更多工作,包括模型适配、算子优化、资源调度和故障管理等。

归根结底,AI算力的价值不在于拥有多少芯片,而在于这些芯片最终能够转化为多少有效的智能产出。


21财经客户端下载