昊梵体育网

西方掐算力,想饿死中国AI。 几轮芯片禁令砸下来,高端GPU的出口通道几乎被堵

西方掐算力,想饿死中国AI。

几轮芯片禁令砸下来,高端GPU的出口通道几乎被堵死,那段时间国内搞大模型的公司是真难受,订单签了,钱付了,货压在太平洋对岸的仓库里就是出不来。

外媒当时的调门出奇一致:中国AI的电源线被拔了,算力枯竭只是个时间问题,硅谷那边甚至有人开始写行业分析,预测中国在AI竞赛里还能撑几个季度。

结果呢?中国工程师没怎么吭声,闷头搞了一年多,递出来一张新单子,8192张卡捏成一台电脑,算力总量照样给你堆上去。

禁售清单还在那儿挂着,但墙后面的地基,跟一年前已经不是一个东西了。

这里头的门道,得拆开看。

西方卡算力的底层逻辑,说穿了是在赌一件事:AI芯片必须用最新一代的。单卡性能越强,训练大模型越快,这是过去十年整个行业默认的路径。

从英伟达的V100到A100再到H100,每一代单卡算力都是翻着跟头往上涨,大家习惯了靠单卡升级来提速。

所以华盛顿那帮人觉得,只要把最新最强的几款卡锁死,天花板就盖住了,中国手里只剩上一代甚至上上代的存货,跟人拼单卡等于拿步枪对冲锋枪,早晚耗尽。

但这个逻辑有个漏洞。

AI计算的本质是大规模并行浮点运算,单卡跑不动的东西,用几百张、几千张卡拆开同时跑,只要卡和卡之间“对话”的速度够快,浮点运算的总和是可以堆上去的。

单卡你比我强五倍,我上八千张卡,用数量优势填平代差,这个道理不复杂,复杂的是怎么让八千张卡真的像一台机器一样协调工作,而不是八千个各干各的散兵游勇。

这不是攒机,跟插显卡拧螺丝完全是两个物种。

八千多张卡塞进一个集群,物理层面的连接就能让没搞过的人直接崩溃,数据不是只在一张卡上算完就完事了,它在训练过程中要在几千张卡之间来回穿梭,每秒钟交换的数据量是天文数字。

如果卡与卡之间的通信带宽不够,数据堵死在半路上,八千张卡的实际利用率可能连一半都到不了,甚至还不如几百张卡跑得快。

这就跟修路一个道理,车再多,路窄了一样全堵在路口,发动机再好使也白搭,这背后需要一套超高带宽的互联网络,专门设计的拓扑结构,把数据通道规划得像城市快速路网一样,主道、辅道、立交桥,一层一层不能有瓶颈。

同时还得有一套调度软件,能把任何一个计算任务瞬间拆成几千份,精准地塞给每一张卡,谁先算完谁先交作业,互相之间不能打架不能空转。

软件硬件得同时往上顶,任何一块短板都会让整个集群的效率雪崩,能把这件事干成,说明在系统级工程这个维度上,已经摸到了最顶尖那几家的门槛。

这其实是一种非常“中国式”的破局思路。

不跟你在你最舒服的赛道上拼单点制程,你禁我高端卡,卡我光刻机,是在单点上把我往下摁,那我换个维度跟你打。

我用架构创新和规模优势,把战场从芯片纳米级拉到我擅长的系统工程级,你卡我一根手指,我整只手攥成拳头砸过来,力道一样能砸出坑。

回头看盾构机、高铁,路径其实差不多。都是先解决有无,再靠体量往下压成本,等国产替代追到一定水平之后,反向把整个行业标准重新洗一遍,现在到了AI算力这个战场,老剧本又开始重播了。

不过得把话说清楚,八千多张卡堆出来的算力巨兽,不是完美的方案。

功耗、散热、占地面积,全是物理天花板。几千张卡全速运转,耗电量抵得上一座小型工厂,散热系统稍微哪个点出纰漏,局部高温就能烧掉一片卡。

而且随着大模型参数继续往上飙,堆卡的边际效益迟早要往下掉,物理和经济上都有一个跨不过去的临界点。

这个方案最大的价值,不是端出一个终极答案,而是抢出了一个极其宝贵的时间窗口。

在这几年里,国产芯片的先进制程在追,先进封装在追,算力底座的两条腿同时在往前迈,等国产工艺追到能跟禁令里的差距缩到一个身位以内的时候,这套“堆数量”练出来的系统能力和自主可控的硬件底座两条腿合并,就真的卡不住了。

有意思的是,这套被迫走出来的路,反而可能改变未来AI算力的竞争规则。

过去几年整个行业太依赖英伟达的单卡升级路线了,CUDA生态太舒服,大家都习惯了等黄仁勋每年发布新卡,插上就能用。

但当这条路被政治因素切断之后,中国这边被迫去死磕分布式集群的效率,去在软件调度和互联架构上往死里优化。

结果发现,哪怕以后高端芯片放开了,这套用中低端卡集群来替代高端单卡的方案,在成本控制上反而有自己的优势。

当然,这条路现在还远没走完,八千张卡的集群能跑起来,不代表能稳定地、低成本地复制到整个行业。

功耗的问题、故障率的问题、运维复杂度的问题,都还在解决过程中,但方向一旦被验证可行,后面就是工程优化的节奏了,而工程优化恰恰是中国科技产业最擅长的那件事。

芯片禁令那堵墙还在,但墙后面的人已经不光是绕路,而是在自己铺路,这场算力博弈的下一章,该轮到谁头疼,恐怕要重新翻牌了。