昊梵体育网

算力管够?!我押GLM大

最近圈子里都在猜,GLM下一代到底是走大还是走小?

有人拿着流出来的聊天截图,说智谱这次要做小模型。

但我觉得,这个解读大概率有点偏了。

大参数、小参数,本来就是相对概念。截图里提到的”小”,更可能只是相对于这一轮行业里的超大参数模型而言,并不意味着真的会转向轻量化路线。据我了解到的信息,新一代GLM的参数规模依然会非常大,很可能仍然处于万亿参数或以上级别。

原因其实也很简单。

智谱现在已经公开释放出多个万卡集群、累计超过1GW级算力基础设施的信号。如果最终只是做一个偏轻量的小参数模型,这样的训练资源多少有点”大材小用”。

但反过来看,它应该也不会为了参数而参数。

过去两年,智谱的路线一直不是追求参数数字,而是把Post-training和Infra一起做的都很好。真正值得关注的,不是模型做得有多大,而是能不能把一个大参数模型,跑出更低的推理成本、更高的部署效率和更稳定的实际表现。

如果真是这样,那这一代GLM想证明的,可能不是”大”或者”小”,而是大参数和高效率,并不矛盾。