近日,山东移动依托完备的算网基础资源布局,联合华为基于AI WAN高算效广域方案,成功完成超300公里长距跨域多数据中心协同训练联合创新,落地业界首次边云协同训练场景下端网协同拥塞控制试点。本次试点创新依托中国移动GSE-DCI先进技术体系,聚焦智算业务专属化、无损化、智能化需求,将成为支撑智算跨地域、跨节点规模化协同的核心基础底座,为全域算力互联互通、资源统筹调度提供核心能力支撑。此次创新标志着山东移动在分布式无损智算领域取得实质性进展,构建起可复制、规模化推广的长距跨域算力协同解决方案,为千行百业超大模型训练提供坚实的算网技术支撑。

当前,大模型训练已迈入十万亿参数时代,单智算节点已暴露出算力不足的瓶颈,难以独立支撑指数级增长的算力需求;多节点、跨域分布式协同训练成为行业主流发展趋势。但长距离跨城组网易产生网络拥塞,造成训练算效大幅下降,叠加数据隐私泄露风险、传输带宽成本高昂等难题,严重阻碍了长距边云协同训练的规模化商用落地。
为此,山东移动依托自身算网资源优势,搭建远距跨城智算协同链路进行现网试点,验证GSE-DCI三大核心技术创新,形成高算效、高安全、高收敛比的核心技术优势:

● RDMA无损传输,长距拉远算效体验不下降:星河路由器内置RDMA无损传输能力,实现300公里远距跨域训练算效保持97%以上。经实测多租户拥塞场景下开启RDMA,算效下降仅2.48%(未开启RDMA时下降高达40.56%)。极致的拥塞控制能力,让长距跨域协同训练,实现与同机房本地集群近乎一致的业务体验。
● 企业数据不出域,数据安全有保障:试点方案中企业原始数据全程保留在企业侧,仅将模型中间特征/参数通过专线传输到远端智算节点,计算完成后结果回传企业侧,由此从源头规避数据泄露,保障企业数据隐私安全。
● 超高带宽收敛比,大幅降低传输成本:创新采用专属缓存技术+拥塞反压机制,实现传输链路64:1的超高带宽收敛比,显著降低传输成本。
本次试点结果表明:大模型TPOT时延(ms)及吞吐(Token/s)下降比例小于3%,符合业务需求并能保持长时间稳定运行。标志着山东移动在分布式无损智算领域取得实质性进展,在面对突发大规模训练算力需求时,山东移动无需新增硬件投入,即可完成全省跨域算力资源整合,快速响应超大模型训练需求。方案证实长距跨域算力协同可规模化落地、具备经济可行性,为全国同类项目提供可复制、可推广的实践经验。未来,山东移动将持续深化智算领域创新,为AI产业创新提供强劲算力支撑,赋能数字经济高质量发展。 







































