深挖推理栈细节,海光 DCU 会是牛来隐藏算力选项吗?
“牛来”爆火之后,大家都在扒硬件底牌,但很少有人把目光放在推理软件栈这条线索上。智谱没有透露芯片选型,我们换个角度,从工程实现层面聊聊坊间猜想。
这次 “牛来”要支撑海量海外调用,离不开SGLang推理框架做深度优化,要扛住极高的token吞吐、百万上下文、高频 Agent 调用,硬件与推理框架的深度绑定必不可少。一套优化过的算子库,不是短时间就能从零完成适配。
海光DCU针对主流开源推理框架持续做算子优化,智谱GLM系列之前在海光平台跑推理,已经沉淀下大量算子、调度层的工程经验。如果“牛来”是GLM-5.3-Flash迭代而来,很大概率会复用这套已经跑通的软件优化成果。
这只是基于开源项目与过往适配记录做的推演,不能作为实锤。理论上也可以从零适配其他硬件,但时间成本、工程难度会高出一大截。从软件复用的逻辑看,海光DCU具备很高的入局可能性,具体依旧等待官方披露。
