资讯
2026/9/16 13:42

腾讯邹贤能:NPO将会快速放量,OCS有望迎来规模化落地

0
0

C114讯 9月16日消息 上周,第二十七届中国国际光电博览会(CIOE中国光博会)在深圳国际会展中心成功举办。

在同期召开的“AI算力集群光互连技术发展论坛”上,腾讯网络及数据中心负责人邹贤能在开场致辞中表示,当前AI产业迎来交付为王的阶段,行业供需关系发生反转:过去厂商问腾讯算力需求,如今腾讯向产业链追问交付能力,这是AI算力爆发带来的 “幸福的烦恼”。

邹贤能指出,伴随MOE大模型、Agent智能体爆发,网络通信开销占训练时长最高可达40%,智算网络瓶颈凸显。腾讯正在从Scale-out横向二层大集群、Scale-up超节点纵向扩容两条路线突破,同时探索OCS光交换、IPOC轻量相干等技术,支撑GW级跨机房智算集群建设。

MOE 大模型 + Agent 推理:网络开销大幅抬升

邹贤能认为,两大趋势正在重塑智算网络需求。 其一,大模型参数持续膨胀,万亿、数万亿参数模型逐步落地,MOE混合专家架构成为主流。专家数量不断增加,网络通信耗时占到模型训练总时长30%~40%,网络不再是算力集群配套,而是核心性能瓶颈。

其二,Agent推理业务高速增长。腾讯WorkBuddy达到数千万日活,单用户三个月Token调用量增长十倍。Agent依靠多轮会话,单次任务消耗海量Token。用户规模、单用户Token消耗量、单Token通信开销三者叠加,带来网络需求的数量级增长。

据邹贤能介绍,10万卡Scale-out集群已经成为腾讯常态。训练流程新增后训练、强化学习环节,训练后期兼具推理特征,对时延、带宽提出严苛要求。传统三层网络架构在超大算力集群里面临明显时延瓶颈,腾讯当前核心攻关方向:基于二层网络搭建数十万卡规模算力集群。依托100G交换机、800G光模块,同时引入无源技术,扩充端口规模,支撑超大集群二层组网。

Scale-up超节点:故障隔离是痛点,OCS成破局方案

邹贤能指出,Scale-up纵向超节点路线,带来显著性能增益。128卡超节点对比传统8卡GPU服务器,单卡推理性能提升40%以上。但超节点有互连距离限制:AEC铜线 + DSP方案仅支持5~7米,只能覆盖64卡、128卡,4柜以上场景无法使用,行业普遍看好NPO技术,预计未来大规模上量。

更大的难题来自故障隔离。传统8卡服务器,单块GPU故障可以单独隔离,不影响其余卡继续训练;但256 卡、512卡超大超节点,如果单卡失效,若没有冗余机制,整组集群都要下线,经济性很差。

对此,腾讯的解法是OCS光交换。邹贤能提到,腾讯早在十年前就开始测试OCS。OCS最大优势是拓扑动态重构。可以利用交换芯片预留端口,接入OCS交换机与备用GPU。一旦超节点内GPU故障,OCS快速切换拓扑,接入备用卡,完成故障替换,保障集群持续运行,OCS有望在智算数据中心迎来规模化落地。

除了Scale-out与Scale-up两种场景外,Scale-across也是个重要应用场景。“GW级智算集群单机房电力难以承载,需要在数公里到十几公里范围内,把多个机房拼接组网。这类场景无法使用普通短距光模块,必须依靠相干技术。过去相干多用于长距传输,现在短距互联成为新赛道。腾讯正在推进IPOC轻量级相干方案,目标降低功耗、压缩成本,满足跨机房短距相干互联需求。”邹贤能表示。

版权说明:C114刊载的内容,凡注明来源为“C114通信网”或“C114原创”皆属C114版权所有,未经允许禁止转载、摘编,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。编译类文章仅出于传递更多信息之目的,不代表证实其描述或赞同其观点;翻译质量问题请指正

给作者点赞
0 VS 0
写得不太好

C114简介     联系我们     网站地图

Copyright©1999-2025 c114 All Rights Reserved 沪ICP备12002291号-4

C114通信网版权所有 举报电话:021-54451141 用户注销