资讯
2026/8/28 17:23

首Token时延降低98.5%,中科曙光ParaCache破除推理瓶颈

0
0

C114讯 8月28日消息(九九)大模型推理正陷入“性能与成本”的双重困局。

一方面,大模型的“自回归”推理回答方式,像得了“健忘症”,需要大量的重复计算,导致推理越来越慢;另一方面,为加速模型思考速度而引入的KV Cache,大量挤占GPU HBM显存,模型越大、上下文越长,成本越高。

当HBM被“打爆”,即便算力充裕也无法响应更多请求,这堵横亘在推理生产化路上的“内存墙”,正在成为全球AI基础设施共同面对的关键议题。

“以存换算,用存储空间换取计算节约,已经成为业界共识。”中科曙光北京公司总裁助理、分布式存储产品部总经理石静近日在接受采访时表示,中科曙光在2026数博会上推出的ParaCache高效管理解决方案,以存算协同为大模型推理打开新的增长空间。

分布式共享存储,构建“多快好省”的Token引擎

石静介绍,ParaCache通过构建分布式共享存储,在硬件层面跨芯片参与计算调度,打通GPU HBM、CPU DRAM、SSD;在运行层面跨请求参与前端应用,消除重复计算,实现周/月/年级别的KV张量复用,从而实现存力对算力的加速、降本和适配,以及Token服务的“多快好省”。

“更快”是指缩短首Token时延,让“第一字”更快出现。首Token时延是用户在使用AI大模型推理时最直接的体验指标,在传统方案中,每轮对话推理输出Token,都要从头计算历史上下文的KV张量,导致推理时间拉长。而ParaCache方案,通过减少计算量加速Token输出,在120K输入长度时,单轮对话最高可降低98.5%至400ms,多轮会话TTFT可降低超80%至4.9s。

“更多”是指提升Token吞吐量,每一秒处理更多推理任务。在高并发、批量处理任务场景,ParaCache方案能够跨GPU构建分布式共享KV缓存池,同一套上下文只计算1次KV,实现“一次计算、多次复用”。释放的GPU算力处理差异化新增Token,显著提升集群整体Token并发吞吐量,最高可提升27倍。

“更省”是指削减Token占用内存,让硬件开销更低。ParaCache方案通过四级缓存:热数据放显存、温数据放内存、冷数据放SSD和分布式存储,大幅降低Token输出对内存硬件的依赖。在内存缩减后,首Token延迟时间也能保持稳定,波动极小。这意味着企业不必为了维持推理速度而被迫“堆内存”,用中低配硬件的成本跑出了高配硬件的上下文长度,单次Token生成的硬件成本直接拉低。

“更好用”是指无缝对接全球推理生态。在全球推理集群领域,LMCache开源技术是KV缓存管理领域的事实标准,从技术社区认可度、主流项目采用度到头部企业落地规模,都广泛领先,成为被共同认可和依赖的基础设施层。ParaCache方案可以无缝对齐LMCache事实标准,在推理侧的技术栈改动小,保护客户现有开源技术投入,降低集群改造风险,实现KV缓存能力的平滑升级。

精准适配四大场景曙光8000十万卡AI超集群验证

在实际应用中,ParaCache高效管理解决方案精准适配长文本对话、知识库问答、智能客服、智能体及高并发推理等核心场景。

石静指出,ParaCache高效管理解决方案已经在中国首个全国产十万卡AI超集群——曙光8000(登峰)中得到实践验证。

在曙光8000的推理应用场景,ParaCache高效管理解决方案实现在GPU HBM、CPU DRAM、本地SSD(含FlashNexus集中式存储)、分布式共享存储等4个层级的池化、动态管理、统一调度与高速存取,有效消除多节点、多卡、多轮推理任务的重复数据加载开销,极大降低推理时延、提高吞吐请求,提升推理业务体验。

面对长上下文对话、重复数据集、相似推理请求,ParaCache高效管理解决方案可直接命中历史缓存结果,仅对新增增量上下文开展迭代计算,从根源上杜绝无效重复推理。

ParaCache高效管理解决方案,搭配智能稀疏、动态淘汰、层级跃迁的无感调度机制,突破传统HBM容量瓶颈、打破AI推理“内存墙”,大幅放大集群推理记忆容积,可从容稳定承载超长上下文推理任务。基于全局共享KV资源池,有效降低Prefill重计算开销,为GPU PD分离推理架构提供全新的KV共享支撑方案。

存算协同架构创新,跑通大模型推理的生产化之路

ParaCache不仅仅是一个KV Cache管理方案,更代表着大模型推理架构的范式变化。

“以前做AI建设,思路就是遇到新瓶颈就堆GPU,但GPU成本高、供给也受限。”石静认为,如果在数据路径上存在无效计算或额外数据搬运,同样不利于GPU效率发挥,“存算协同不是短期的技术改良,而是大规模训推生产化的必然趋势。”

这一趋势正在重构AI集群的建设思路。过去规划只看GPU算力,如今已变为算力、存储、网络、缓存一体化规划;选型也更加从TCO角度出发,将SSD和分布式存储纳入KV Cache管理体系,平衡硬件与性能的占比。

与此同时存储本身的定位也在发生深刻变化:存储已经跳出了单纯的数据容器,从被动的IO响应转向深度的数据调度、缓存复用、计算卸载。这是AI驱动下数据基础设施的一次结构性变化,也为国内厂商带来了机遇——在存算协同赛道上,立足于国内私有化、私有域的数据化支撑,可以做更多自主创新

石静指出,“大模型继续发展,能不能管好KV Cache可能会影响整个推理应用的服务成本、响应速度,还有Agent的扩展能力。”这或许正是ParaCache成为“Token引擎”的价值所在:当KV Cache从GPU的临时负担变成可共享、可流转、可资产化的智能数据,大模型推理的生产化之路才能真正走通。

版权说明:C114刊载的内容,凡注明来源为“C114通信网”或“C114原创”皆属C114版权所有,未经允许禁止转载、摘编,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。编译类文章仅出于传递更多信息之目的,不代表证实其描述或赞同其观点;翻译质量问题请指正

给作者点赞
0 VS 0
写得不太好

C114简介     联系我们     网站地图

Copyright©1999-2025 c114 All Rights Reserved 沪ICP备12002291号-4

C114通信网版权所有 举报电话:021-54451141 用户注销