仅作行业科普不构成投资建议,英伟达Vera Rubin正在全球扩大部署。

这场被外界吹捧为AI算力新里程碑的部署,在背后是藏着不少被忽略的行业暗线的,并且不全是利好的消息。

目前CoreWeave、谷歌云、微软等头部科技厂商都已经下单采购了该系统,而官方的目标是搭建新一代的千兆级AI工厂,因此去解决万卡集群协同的通信痛点。

从制造端来看,这款平台的交付是从一开始就被卡住了脖子的,并且台积电的先进封装产线产能是紧张的,良率爬坡的速度也远低于预期,这些因素直接拖慢了全球的交付节奏,但是成为了物理层面制约AI迭代速度的隐形瓶颈。

很少有人关注到散热材质的隐秘变动,为了应对NVLink Switch芯片暴增的功耗,厂商不得不把原本计划用的铝制液冷管路紧急换成钛合金的,并且这一调整不仅拉高了制造成本,也使现场部署的技术难度增加了。
很多人直觉认为万卡互联的极致效率只会带来更好的体验,但是反过来看,这种高度协同的架构反而是放大了风险的,只要一个节点出现散热失效的故障,就可能让整个集群的计算中断,因此高性能和高脆弱性从来都是绑定在一起的。

不同厂商的定价策略也暗藏玄机,CoreWeave走的是裸金属租赁路线,而传统云巨头卖的是虚拟化切片,中小创业公司选裸金属虽然能拿到更好的性能,但是单位算力成本却比虚拟化方案高出三成左右,因此进退都有难处。

这次快速迭代其实对英伟达自家的存量客户并不友好,不到一年就推出新一代平台,很多刚采购完上一代产品的云厂商,直接陷入了资产搁浅的困境,并且就像森林里新长出的树冠抢走了老树的阳光,只能提前折价淘汰设备了。

宣传中提到的十倍Token吞吐提升,其实是用FP4低精度算力换回来的,放到对精度要求更高的科学计算场景里,而实际的效率提升是远没有宣传的那么夸张的,因此很多行业人士都已经意识到了“算力虚增”的陷阱。
这次三十个国家同步铺开的计划,也引发了不少业内的担忧,超大规模的算力倾销式部署,如果让很多原本算力需求不足的地区跟风上马大项目,最后就会重蹈十几年前光缆泡沫的覆辙,因此造成大量的资源闲置和投资浪费。

有网友留言说“千兆级AI工厂具体啥样?真想看看实际效果啊~,英伟达这波又把竞争对手甩几条街了,其他厂商只能干瞪眼咯~”但是竞争对手并没有坐以待毙,并且AMD已经推出了面向中小企业的开放架构加速卡,同时谷歌也在力推自家的TPU,都是在寻找打破封闭生态的突破口。

站在普通从业者的角度看,现在AI行业的内卷已经从算法端蔓延到了基建端,大家都在拼谁的算力更大、谁的技术更新,但是却很少有人停下来算一算,这些快速迭代的硬件,到底有多少是能真正产生商业价值的。
不管技术怎么发展,理性看待升级、匹配自身需求才是最稳妥的选择,因为盲目的跟风追捧,最后买单的还是那些没有足够资源扛风险的中小玩家。