昊梵体育网

全中国都在骂老美卡芯片脖子,但梁文锋却点出了更恐怖的真相:就算把算力全给你,如果

全中国都在骂老美卡芯片脖子,但梁文锋却点出了更恐怖的真相:就算把算力全给你,如果骨子里改不掉模仿的惯性,中国AI还是个追随者。技术能买,但原创的脑子买不来。

有人跟我说,AI不就是个工具吗,跟我有什么关系?

好多人都在骂,说老美不讲规矩,硬生生把我们发展 AI 的路给堵了。但前阵子看到深度求索的梁文锋说的一番话,我觉得比芯片卡脖子这件事,更值得我们沉下心琢磨琢磨。

先说说咱们现在 AI 的家底,说出来其实挺提气的。截止到今年年中,我们已经发布了 1509 个大模型,占了全球总数的 40%,数量是实打实的全球第一。智能算力规模也到了 788 百亿亿次每秒,比去年同期翻了快三倍,首个全国产的十万卡 AI 超集群也已经投入使用了。

国产大模型的全球总下载量都突破 100 亿次了,好多头部模型在国际排行榜上都能排到前列。跟海外顶尖模型的技术差距,从最开始的两年左右,缩短到现在半年上下。乍一看,好像就算老美卡着芯片,我们自己攒算力、做模型,也能把 AI 产业搞起来,甚至再过几年就能反超。

但梁文锋说的话,刚好给这种热闹的势头浇了一盆凉水。他的意思大概是,别光盯着算力够不够,就算现在把全世界的算力都摆在你面前,如果骨子里改不掉模仿的惯性,那中国 AI 到最后还是个追随者。技术能买,设备能买,但是原创的脑子是买不来的。

这话听着有点刺耳,但仔细捋捋还真是这么回事。就说这几年的大模型热潮,最基础的 Transformer 架构,是谷歌 2017 年先提出来的。后来 OpenAI 把 ChatGPT 做火了,国内一夜间就冒出来上百个大模型,好多都是拿海外的开源模型微调一下,换个界面就上线了。

人家出了思考链推理技术,我们这边半年之内,所有头部模型就都跟上复现了;人家搞混合专家架构提升效率,我们紧跟着也都布局 MoE 方案。跟进的速度确实快,成本也低,别人踩过的坑我们都不用踩,沿着现成的路跑就行,见效特别快。

这种发展模式放在以前的传统产业里确实好使,比如早年的家电、后来的智能手机,都是先引进技术,再消化吸收,最后靠着成本优势反过来抢占市场。但 AI 这东西不一样,这是底层的技术革命,真正的壁垒从来不是你把模型做的多大、算力堆的多高,而是你能不能找到下一个技术方向。

别人已经趟出来的路,你跑的再快,也是在别人的赛道里。哪天人家换了个全新的技术路线,不玩现在的 Transformer 架构了,我们之前堆的所有算力、做的所有适配,很可能一下子就落后了一大截。

就拿梁文锋自己的团队举例,他们做 DeepSeek V3 的时候,只用了 2048 块 H800 芯片,这还是受美国出口管制的低配版本。而 GPT-4 训练的时候,用了大概两万五千块 A100,单卡性能差了一代,数量差了十几倍。

但最后测出来的性能,两款模型在主流基准测试里的差距小到几乎可以忽略。他们靠的不是堆算力砸钱,是自己改底层架构,自己优化训练算法。像多头隐式注意力机制、组相对策略优化算法这些,都是他们团队原创的技术。后来他们的 R1 模型还登上了《自然》杂志的封面,靠纯强化学习提升模型推理能力,这就不是跟着别人屁股后面走的路子了。

经常有人跟我说,AI 不就是个聊天写文案的工具吗,跟我普通老百姓有什么关系?其实真不是这么简单。以后 AI 会慢慢渗透到各行各业里,医院看病用 AI 辅助诊断,工厂生产用 AI 调度流程,学校上课用 AI 定制学习方案,甚至我们平时刷的视频、用的手机 APP,背后都有 AI 在运转。

如果底层的核心技术都是别人原创的,行业规则都是别人定的,那我们就永远要跟着人家的标准走。人家收多少专利费我们就得给多少,人家说限制什么技术我们就用不了。表面上看我们应用做的热热闹闹,实则根子攥在别人手里,随时都有可能被卡一下。

我觉得,美国卡芯片这件事,是明面上的困难,大家都看得见,也都在集中力量解决。华为的升腾、寒武纪这些国产芯片,现在已经开始大规模替代海外产品了,再过个三五年,高端算力芯片的坎我们大概率能迈过去。

但模仿的惯性这个事,是藏在水面下的,不容易被看见,改起来也更难。毕竟走捷径快啊,跟着别人已经验证过的方向做,不用承担试错的风险,很快就能出成果、赚快钱。而做原创的基础研究,可能砸进去好多钱,熬上好几年,最后什么落地的成果都没有,换哪家企业都得掂量掂量。

但掂量归掂量,这条路总得有人往前走。以前我们底子薄,没钱也没足够的人才,跟着别人学是没办法的选择。现在我们有全球最大的应用市场,有数量最多的工程师,算力规模也上来了,要是还一直停留在模仿追赶的阶段,那就太可惜了。

就像梁文锋说的,做基础研究不能只算眼前的经济账,不能说投入了马上就要有商业回报。真正的原创突破,往往都是从好奇心开始的,不是靠 KPI 逼出来的。