昊梵体育网

从推理栈判断,“牛来”背后的卡八成是海光DCU 说实话,这两天一直在琢磨“牛来”

从推理栈判断,“牛来”背后的卡八成是海光DCU
说实话,这两天一直在琢磨“牛来”背后10万张卡的事。智谱没有点名,却勾起了大家的好奇心,我刚翻了翻他们披露的技术方案,发现答案其实挺明显的。
先说推理栈。“牛来”线上跑的是改造版SGLang,E-P-D分离架构、FP8/W8A8量化、MLA/KV Cache压缩、MoE的EP/CP并行——这一整套技术组合拳,海光DCU在GLM-5.1时就已经跑通了。算子、融合算子、通信原语全在DTK上验证过。而且SGLang在海光DCU上有天然优势,RadixAttention缓存复用能最大化利用2.4TB/s的高带宽,实测吞吐比vLLM高出24%。
再看模型本身。GLM-5.3-Flash是MoE 320B总参/18B激活,带稀疏+线性注意力、1M上下文,跟GLM-5/5.1架构一脉相承。海光已经在前代MoE模型上做过深度性能调优,工程上平滑迁移到5.3-Flash几乎没障碍。
我就想说一句:其他几家国产芯片供应商,谁在GLM-5发布当天就完成了Day0适配?公开信息能对上号的,目前大概率只有海光,大家觉得吗?
智谱GLM53 海光DCU