上证报中国证券网讯(年悦 记者 张雪)中科曙光8月28日发布新一代词元加速方案ParaCache。据了解,该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。 随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。中科曙光分布式存储产品部总经理石静在接受采访时表示,通过“以存换算”节约算力已经是业界共识。 据介绍,ParaCache通过统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。 石静表示,存储已经从被动的IO响应,转向深度的数据调度、缓存复用、计算卸载,这是AI驱动基础设施的一次结构性变化。 目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,并已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。
上证报中国证券网讯(年悦 记者 张雪)中科曙光8月28日发布新一代词元加速方案ParaCache。据了解,该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。
随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。中科曙光分布式存储产品部总经理石静在接受采访时表示,通过“以存换算”节约算力已经是业界共识。
据介绍,ParaCache通过统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。
石静表示,存储已经从被动的IO响应,转向深度的数据调度、缓存复用、计算卸载,这是AI驱动基础设施的一次结构性变化。
目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,并已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。