当前位置: 首页 » 资讯 » 新科技 » 正文

让大模型少做重复计算 中科曙光发布ParaCache

IP属地 中国·北京 编辑:江紫萱 上海证券报 时间:2026-08-30 14:09:57

上证报中国证券网讯(年悦 记者 张雪)中科曙光8月28日发布新一代词元加速方案ParaCache。据了解,该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。 随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。中科曙光分布式存储产品部总经理石静在接受采访时表示,通过“以存换算”节约算力已经是业界共识。 据介绍,ParaCache通过统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。 石静表示,存储已经从被动的IO响应,转向深度的数据调度、缓存复用、计算卸载,这是AI驱动基础设施的一次结构性变化。 目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,并已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。

上证报中国证券网讯(年悦 记者 张雪)中科曙光8月28日发布新一代词元加速方案ParaCache。据了解,该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。

随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。中科曙光分布式存储产品部总经理石静在接受采访时表示,通过“以存换算”节约算力已经是业界共识。

据介绍,ParaCache通过统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。

石静表示,存储已经从被动的IO响应,转向深度的数据调度、缓存复用、计算卸载,这是AI驱动基础设施的一次结构性变化。

目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,并已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。