昊梵体育网

高并发吞吐量最高提升27倍?OMG中科曙光你吓到我了 数博会最热闹的展台,中科

高并发吞吐量最高提升27倍?OMG中科曙光你吓到我了

数博会最热闹的展台,中科曙光算一个。但今天不说别的,就说说中科曙光在数博会上发布的新方案——ParaCache高效管理解决方案。
这个方案真的太值得好好聊聊了,要知道,大模型推理中大量的计算其实是重复的。举个例子,一个知识库问答场景,100个用户问的是同一批行业文档。传统方案下,这100个请求各自独立计算,同一批内容被算了100遍。GPU资源就这么被白白浪费了。

中科曙光ParaCache方案做的是,跨GPU构建分布式共享KV缓存池,同一套上下文只算1次,然后复用。
“一次计算、多次复用”。效果也是没得说,高并发场景下,模型Token吞吐量最大提升27倍。

27倍什么概念?27倍什么概念?原来1秒处理1个请求的,现在能处理27个。原来支撑100个并发用户的,现在能支撑2700个。
做AI SaaS的都知道,并发能力直接决定你能接多少客户、能收多少钱。后来中科曙光展台前的人越围越多,大家都一直问这套方案。这个提升幅度,真的太有吸引力了。

数博会 ParaCache 中科曙光 AI中科曙光ParaCache