返回新闻列表
2026-08-29 07:40
AI123

中科曙光发布ParaCache词元加速方案,大模型首词元时延最高降低98.5%

大模型规模化落地正将算力消耗重心从训练推向推理。IDC预测,到2027年中国智能算力规模中推理占比将提高到72.6%。在此背景下,2026年中国国际大数据产业博览会期间,中科曙光正式发布面向大模型推理的词元加速方案ParaCache。中科曙光分布式存储产品部总经理石静在接受采访时表示,该方案以ParaStor分布式存储为底座,构建覆盖GPU显存、CPU内存、SSD与分布式存储的四级缓存池,兼容vLLM、SGLang等主流推理框架。

据介绍,针对大模型推理中的“显存墙”问题,ParaCache采用“以存换算”思路,将KV Cache从显存卸载至更大容量、更低成本的存储介质。实测数据显示,在120K输入长度下,单轮对话首词元时延最高降低98.5%至400毫秒;多轮会话首词元时延降低超过80%至4.9秒;高并发场景词元吞吐量最大提升27倍。目前该方案已部署于曙光8000超集群,并在金融、教科研等场景落地,例如某银行信用卡中心并发吞吐量提升约3倍,教科研知识库问答场景并发度提升15倍至20倍。

石静认为,存算协同是大模型训推走向规模化生产的必然趋势。KV Cache正从用完即弃的临时数据,转变为可反复调用的数据资产,GPU围绕这些数据提供Prefill与Decode计算能力。存储的定位也随之改变,从被动的IO响应转向主动的数据调度、缓存复用与计算卸载。她同时指出,KV Cache复用收益依赖公共重复上下文,短请求、不复用的场景收益有限,实时交易类等时延敏感型业务仍须依赖HBM。

来源
  1. 2026-08-29 07:00 | 新浪财经:“以存换算”成为AI推理共识 存储厂商切入算力优化赛道
    阅读原文

    大模型规模化落地,正在把算力消耗的重心从训练推向推理。IDC预测,到2027年中国智能算力规模中推理占比将提高到72.6%,推理算力增速远超训练。推理环节的成本与效率,随之成为AI基础设施的新议题。存储行业自身也处于涨价周期。高盛研报显示,2026年全球DRAM、NAND闪存、HBM的供需缺口分别达到4.9%、4.2%、5.1%,均为2011年以来最高水平,AI服务器贡献了超过50%的DRAM总需求。存储颗粒持续紧缺,大模型推理对显存、内存的消耗仍在放大。2026年中国国际大数据产业博览会期间,中科曙光(85.820, -0.72, -0.83%)面向大模型推理的词元加速方案ParaCache...

其他新闻

查看全部