数博会第二天,我在中科曙光展台看到了AI Infra的未来
今年数博会主题是“词元”,展馆里大家都在聊大模型怎么落地,但真正赚钱的生意,其实都在底层:怎么把Token生成的成本打下来。
逛到中科曙光展台,数博会期间他们刚发布了一个ParaCache词元加速方案,感慨挺深。过去一年,很多做AI应用的朋友都在抱怨,推理成本太高,用户一多,GPU显存就爆,钱全烧在内存上了。甚至有同行说“快被KV Cache搞破产了”。
现场了解到,中科曙光这套方案,本质上是用存力换算力。他们不再把KV Cache当成临时数据用完就扔,而是当资产存下来重复利用。在曙光8000这个十万卡集群里,跨节点共享KV缓存,消除了大量重复计算 。
这个逻辑如果在行业内铺开,会改变很多事。第一,做长上下文、高并发的AI应用门槛会大幅降低;第二,推理成本降下来之后,To C的AI应用商业模式会更健康;第三,国产算力集群在推理侧的性能短板,有希望用存力来补。商业前景如何另说,至少方向是对的。
数博会现场 中科曙光ParaCache
