国产推理芯片迎来新思路,摩尔线程发布全新技术方案,瞄准大模型长上下文痛点
大模型越做越大,长文档解读、AI Agent这类应用越来越普及,推理算力的短板,开始慢慢暴露出来。就在近期,摩尔线程对外发布全新技术白皮书,推出一套名为Prefill‑as‑a‑Service的推理新范式,专门用来解决超长上下文场景下面,大模型推理效率低、成本居高不下的老难题。
很多人不太理解大模型推理的痛点,简单来说,大模型处理任务分为两个关键环节。一个叫Prefill,接收用户输入的海量文本,做计算处理,极度消耗算力;另一个叫Decode,逐字把回答生成输出,更加吃内存访问。过去绝大多数推理框架,会把两套流程绑定在一起跑,资源很难灵活调配,遇到几十万Token的超长文档,很容易出现响应慢、算力浪费严重的情况。
这套新方案,就是把这两个环节拆开,做异构解耦处理,分开调度硬件资源。测试数据显示,基于国产MTT S5000智算卡,64K上下文场景之下,单机八卡可以做到很高的吞吐性能,就算拉到400K超长上下文,依旧可以维持稳定运行表现,同时这套方案还兼容市面上主流的推理框架,不用企业大规模改动原有代码就可以直接接入使用。
放到真实的业务场景当中,这套技术可以服务很多实际需求。企业读取整本合同、海量历史资料做分析,AI智能体连续多轮长对话,代码模型处理几十万行程序文件,都属于超长上下文的范畴。之前想要跑通这类业务,企业要投入非常高昂的算力成本,国产方案如果可以把推理的总体拥有成本打下来,对于国内大量AI企业来说,是实实在在的利好。
很长一段时间,大家聊国产AI芯片,更多把目光集中在训练性能上面。但现实当中,绝大多数AI公司,日常花的钱,大头其实都消耗在推理环节。模型训练只需要跑一次,但是面向用户的每一次提问、每一次调用,都要反复执行推理计算。推理侧技术的突破,直接关系AI产品能不能赚钱,能不能实现商业化落地。
当然技术白皮书公布方案,不等于就直接大规模落地。纸面测试的亮眼数据,还需要经过互联网真实业务流量的打磨,在复杂多变的真实请求当中,验证稳定性和综合表现。
不可否认的一点是,国产算力赛道,已经不再只盯着对标海外硬件参数,开始根据国内产业的真实业务痛点,走出属于自己的优化路线。训练比拼之后,大模型推理,正在成为国产芯片新的主战场。高端算力芯片 cpo芯片 电子算力芯片 摩尔线程市值 英特尔算力芯片 英特尔算力 芯片设计开发
