资讯
2026/9/7 15:54

锐捷网络的超节点进阶之路:从产品创新到协议共建

0
0

C114讯 9月7日消息(九九)随着大模型从训练走向推理、从单点智能走向规模化落地,AI算力集群的形态正在被深刻重塑。

在此背景下,行业大厂纷纷推出自研超节点产品,锐捷网络也在2026开放数据中心大会暨首届算博会(2026ODX)期间展出其基于以太网互联的超节点产品方案——RG-ETH 128,该方案将计算节点与交换节点进行协同设计,并引入800G LPO光模块、风液混合散热等技术。

会议期间,锐捷网络超节点解决方案专家刘洋在接受C114专访时表示,锐捷网络已围绕AI数据中心形成较为完整的技术体系,并在ODCC中参与ETH-X标准制定、贡献Switch Tray的建设指导意见,从产品创新走向协议共建,参与到超节点网络技术标准化的建设中。

面对算力密度与通信效率的双重挑战,Scale-up技术路径应运而生,通过将多GPU纳入同一高速互联域,为超节点内部通信开辟了一条“快车道”。

Scale-up,面向超节点的网络“快车道”

刘洋指出,大语言模型发展迅猛,基于MoE的专家并行成为主流模型架构,一个明显的趋势是专家数量越来越多,基于“一卡一专家”的部署方式被广大用户认可,128或256专家需要相应数量的GPU卡一起做训练或推理。GPU之间的通信如果按传统Scale-out方式部署,受限于服务器网卡的带宽会比较低,导致通信耗时增加,影响运算效率。

把原本在Scale-out网络中传输的流量搬进Scale-up域去传输,相当于“给它换了一条更快的车道”,降低通信耗时,进而提升运算效率。而超节点正是Scale-up技术路线演化出的产品形态:将若干GPU放进同一个Scale-up域内,组成新的服务器系统化产品。

锐捷在ODCC标准指导下开发的研发工程样机——RG-ETH 128超节点,设有16个计算节点,每个节点包含1个CPU和4个GPU,整机合计64张GPU卡。该方案的一大亮点是Host Tray,当前整机柜默认支持64张GPU卡互联,若想实现更高密度,可以通过Host Tray把计算节点中的CPU独立出来,实现CPU-GPU分离,每个计算Tray内可部署8张OAM卡,从而在解耦的前提下实现单机柜128卡的互联密度。

在带宽方面,RG-ETH 128配备的8个交换节点可以支持单GPU 3.2Tbps的以太网直出带宽;时延方面,采用250纳秒的低延迟交换芯片可以更好地满足Scale-up转发;可靠性方面,支持LLR、CBFC等先进技术;确保XPU之间更高带宽、更低时延、更高可靠的互联。

产品落地,标准先行。刘洋介绍,锐捷早在两年前便与ODCC网络项目组共同推进ETH-X标准,并贡献了Switch Tray的建设指导意见。可以说,锐捷是ODCC的积极参与者,持续为ODCC等开源社区贡献软件功能特性和标准制定,并多次参与ODCC全会及网络工作组会议,共同探索智算领域网络发展路径。

标准与技术的双重积淀,正加速转化为工程交付能力。目前锐捷的超节点产品已在头部互联网公司以Switch Tray组件的方式实现规模交付。谈及超节点的未来演进,刘洋认为,RG-ETH 128可视为“超节点1.0”,它基于Cable Tray等成熟工艺,是目前最容易落地部署的架构。但展望未来,Scale-up域必然逐渐扩大,单机128、256乃至更大规模需要技术实现路径。一方面是铜互联继续演进,将SerDes从112G升级至224G,减少Cable Tray线缆密度、提升良率;二是当Scale-up域发展到512卡乃至1024卡时,走向超节点光互连。

然而,无论Scale-up域如何扩展,单一超节点的算力终究存在物理上限。当集群规模向万卡、十万卡级迈进时,横向扩展成为必然选择,这也对集群级网络提出了全新命题。

Scale-out:从“连接提供”走向“计算效率优化”

国家数据局今年3月份的统计数据显示,中国每天Token调用量已突破140万亿,从2024年初的1000亿增长到2025年底的100万亿,两年时间增幅达1400倍。推理负载的爆发式增长,使单纯依赖单卡算力提升的模式难以为继。在超节点规模向万卡、十万卡级扩张的过程中,Scale-out网络作为集群横向扩展的核心底座,其重要性愈发凸显。

刘洋提出,超节点规模越来越大之后,Scale-out网络面临四个维度的挑战:

其一,集群规模扩张持续放大网络规模,局部链路或设备故障的影响范围同步扩大,故障爆炸半径显著提升;

其二,大模型训练与推理产生大量高带宽突发流量,传统ECMP等价路由存在明显的哈希不均缺陷,比如在640卡GPU集群的AllReduce测试中,部分链路因拥塞导致整体网络性能仅为理想状态的60%,负载不均衡成为大规模Scale-out网络的核心性能瓶颈之一;

其三,Scale-out网络需同时承载训练大象流、推理小包流、KV Cache存储流量等多类异构流量,流量混跑易引发性能劣化,性能隔离与QoS保障成为新的挑战;

其四,超节点架构下部分EP/TP流量被收敛至超节点Scale-up域内,Scale-out网络还需适配故障域扩大、硬件资源集约化等变化,对原有架构设计提出了新的适配要求。

在刘洋看来,Scale-out网络的演进将围绕“更高带宽、更智能调度、更强AI感知、更易运维”展开:带宽持续从400G、800G向1.6T乃至更高速率演进,拥塞控制与流量调度能力向智能化升级,AI流量特征感知可自动识别训练、推理、存储等不同流量并动态调整资源分配,可观测性与故障定位能力持续强化。

总之,未来Scale-out网络的核心价值也不再局限于提供连接,而是会围绕AI计算效率进行全链路优化,通过网络侧的能力提升,降低AI任务的通信开销,提升整体集群的计算效率。

在单集群内部连接效率持续优化的同时,算力集群对互联带宽、密度与距离的要求也在同步攀升。无论是Scale-up域突破铜缆极限、向更大规模演进的内在驱动,还是跨地域算力协同的外部需求,光互连都已从“可选项”变为“必选项”,成为超节点网络下一阶段的关键变量。

光互连:超节点互联的技术演进与锐捷布局

随着大模型训练、推理业务规模持续扩张,单一园区的算力、电力资源已无法满足超大规模集群的部署需求,跨地域、跨数据中心的算力协同成为刚需。光互连凭借在距离、带宽、密度等方面的显著优势,不仅是跨域互联的物理基础,也是Scale-up域从当前电互联向512卡乃至更大规模演进的必然方向。

光互连的核心价值体现在两个维度:一方面将互联距离大幅拉远,支撑跨地域算力池化;另一方面突破机柜内部铜缆的密度与带宽瓶颈,支撑更大规模的节点高速互联。

尽管光互连在距离与带宽上优势显著,但刘洋也坦言,其落地仍需一定周期,产业链还需解决光互连的可靠性问题,例如光闪断带来的业务中断、光纤脏污带来的误码率提升等。一旦走向光互连,整机可实现高密度计算节点,交换机可外置至独立交换柜以NPO方式互联。业界比较认可的方式是将光电转换引擎尽可能贴近GPU卡,与GPU芯片共同集成在GPU模组上——“离GPU越近,链路损耗越小,信号完整性越优,这是目前我们看到的一个趋势。”

为突破上述技术门槛,锐捷在光模块领域构建了从研发到生产的全栈自主能力,自主研发产品主要基于线性直驱技术的LPO与NPO方案。在LPO方面,目前400G产品已实现量产,并规模应用于客户的数据中心;800G与1.6T产品正在紧锣密鼓开发中。在NPO方面,锐捷积极参与ODCC的UPO等相关规范,将推出3.2T与6.4T两个形态,预计今年末可提供测试样品。

“将LPO模块或NPO模组应用于系统需要端到端评估,我们一方面可以在端侧将GPU与OE结合,另一方面能够实现从GPU到交换机端到端光电链路的仿真与优化,这是很重要的能力。”刘洋说:“把产品做出来很简单,真正用好它、把误码率控制在很低的水平,才是技术门槛。”

基于从LPO量产到NPO预研的全栈实践,锐捷对光互连的演进路径形成了系统判断:LPO落在对可维护性要求高的中短距场景,NPO贴近芯片承担高密度Scale-up互联,CPO则瞄准未来超大密度、超低功耗的演进方向。在锐捷看来,未来更可能形成短距离电互连与高速光互连协同发展的架构,而非简单的“光替代电”。光互连作为锐捷超节点技术体系的重要组成部分,正推动其产品能力从电互联时代向光电融合时代迈进,也为其从单一产品交付走向技术标准共建奠定了坚实基础。

从交付Switch Tray组件,到推出完整的RG-ETH 128超节点产品,再到深度参与ODCC标准共建,锐捷在超节点网络赛道上完成了一次从“产品创新”到“协议共建”的跃迁。在AI算力基础设施从“堆机器”走向“系统工程”的进程中,这或许正是其最适合的进阶之路。


版权说明:C114刊载的内容,凡注明来源为“C114通信网”或“C114原创”皆属C114版权所有,未经允许禁止转载、摘编,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。编译类文章仅出于传递更多信息之目的,不代表证实其描述或赞同其观点;翻译质量问题请指正

给作者点赞
0 VS 0
写得不太好

C114简介     联系我们     网站地图

Copyright©1999-2025 c114 All Rights Reserved 沪ICP备12002291号-4

C114通信网版权所有 举报电话:021-54451141 用户注销