昊梵体育网

中科曙光扔出Token核弹,大模型推理的黄金时代终于来了? 这两天参加了数博会,

中科曙光扔出Token核弹,大模型推理的黄金时代终于来了?
这两天参加了数博会,大会期间中科曙光发布了新一代词元加速方案ParaCache,我的第一感受就是:推理圈的“游戏规则”被彻底改写了。
大模型推理最大的死穴是什么?Token越算越慢、显存越吃越贵。每生成一个字都要把历史KV重算一遍,16K长度就是2.56亿次键值对计算,这哪是推理,这是在烧钱!中科曙光这次发布的词元加速方案,直接掀翻了这套陈旧逻辑:让大模型“过目不忘”,每一次Prefill都成为长期数据资产。
怎么做到的?四级缓存池把显存、内存、SSD、分布式存储全线打通,热数据毫秒级响应、冷数据智能预取唤醒。实测数据很硬:120K超长输入首Token时延狂砍98.5%降至400ms,高并发吞吐量最大提升27倍!更恐怖的是,缓存容量下调,系统性能也几乎不变——这意味着中低配硬件跑出超算级体验,TCO直接被按在地上摩擦。
曙光8000十万卡集群已经率先验证,在长下文对话、高并发在线推理、智能体工作流等场景中,ParaCache都抗住了生产级考验。这已经不是优化,这是Token效率的“核聚变”。存储从看仓库的逆袭成推理总指挥,AI基础设施的天,变了。
中科曙光数博会TokenAI算力中科曙光ParaCache