昊梵体育网

#GLM-5.3 Flash# 智谱新模型“牛来”跑在10万国产卡上 8月26日,智谱正式确认海外爆火的匿名模型Ox‑Alpha(昵称“牛来”)为自家GLM‑5.3‑Flash模型。 该模型匿名测试阶段在OpenRouter、OpenCode平台流量暴涨,5天超50万亿token,使用量超DeepSeek两倍,全部推理流量由超10万张国产芯片承载,芯片 ​

GLM-5.3 Flash 智谱新模型“牛来”跑在10万国产卡上

8月26日,智谱正式确认海外爆火的匿名模型Ox‑Alpha(昵称“牛来”)为自家GLM‑5.3‑Flash模型。

该模型匿名测试阶段在OpenRouter、OpenCode平台流量暴涨,5天超50万亿token,使用量超DeepSeek两倍,全部推理流量由超10万张国产芯片承载,芯片供应商传闻涉及华为、摩尔线程、海光。

智谱通过定制推理引擎、EPD分离式架构等技术优化,服务性能提升3倍,硬件效率、单token成本达到英伟达GPU同等水平,海外机构SemiAnalysis评价,这意味着英伟达CUDA护城河再次迎来考验。

该模型总参数320B、激活参数18B,为GLM‑5系列首个原生多模态模型,AA综合指数57分,性能对标Claude Opus 4.8;定价仅为Claude Opus 4.8的1/40,在行业涨价潮下主打高性价比,瞄准市场需求缺口。

定价方面,GLM-5.3-Flash每百万token输入0.8元,输出2.8元,缓存命中价格0.23元,为GLM-5.3的十分之一。上线前两周实行半价。

智谱表示,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Claude Opus 4.8的1/40。

与调价后的DeepSeek V4 Flash相比(谷时输入1.5元、输出4.5元),GLM-5.3-Flash在绝大多数常规调用场景下更便宜。