昊梵体育网

以前以为三万美元一张的 H200 是顶级巨头的专属玩具,现在回头一看,好家伙,H

以前以为三万美元一张的 H200 是顶级巨头的专属玩具,现在回头一看,好家伙,H200 居然已经在物理意义上变成了“丐版”。

英伟达刚刚官宣了最新一代 Vera Rubin 架构的实测数据。

确实吓人。对比 GB300 NVL72,Vera Rubin 每兆瓦的吞吐量飙升了 30 倍,Token 成本暴降 35 倍。

如果把这两年的硬件演进拉成一条线,背后的经济学逻辑简直堪称玄幻:

从 H200 到 GB300,跑 DeepSeek V4 Pro 真实 Agent 负载,每兆瓦吞吐量最高提升 30 倍,整机价格大概翻 2 倍。

从 GB300 到 Vera Rubin,同一套模型和测试,吞吐量再猛增 30 倍,整机架价格又大概翻 2 倍。

按照老黄 PPT 上这套乘法算下来:

性能:30 × 30 = 900 倍。 价格:2 × 2 = 4 倍。

合着这两年英伟达最大的技术突破,根本不是芯片架构本身,而是成功说服了各大公司的 CFO——让你们贵了 4 倍,换来 900 倍的速度。说实话,拿这套算法去创业拉融资,PPT 都不敢这么写,但老黄硬是用硅片给堆成了物理现实。

为什么性能提升能拉出这种指数级离谱曲线?因为 AI 行业的“工作负载”发生了根本性的范式转移。

以前大模型做 Chat 或者总结,几十步、几千 Token 就拍屁股走人,芯片比拼的是纯粹的浮点算力。但现在的 Agent 时代截然不同:一个自动写代码、跑测试的智能体,单次任务要不断自我纠错、调用工具,上下文动辄绵延几百个步骤、几十万 Token。

在这种超长上下文的连环轰炸下,卡死性能瓶颈的早就不再是“算得快不快”,而是“数据搬运得够不够快”。

GB300 到 Vera Rubin 这种核弹级的进步,本质上是把显存带宽、NVLink 级联和 KV Cache 的内存调度压榨到了极致。老黄这不是在建更快的算力工厂,而是直接在芯片内部铺了满格的高铁网。

最绝的是,行业过去都笑称老黄是“卖铲人”,铲子卖得比黄金还贵。

现在看,他哪里是在卖铲子,他分明是看大家用铲子挖井不够快,直接把铲子改造成了盾构机,然后微笑着问你:看,虽然这套设备贵了几倍,但单位掘进成本帮你省了 35 倍,你买不买?

算力贬值的速度,已经彻底碾压了财务折旧的逻辑。以前买 H200 的大厂,机房散热风扇还没吹明白,服务器就已经在报表上退化成了“遗老遗少”。摩尔定律在老黄的物理魔法面前,显得像个老态龙钟的步行者。

只能说,在这场看不到终点的算力竞赛里,最焦虑的可能不是买不起卡的小公司,而是那些刚刚下订单买了 GB300、以为能安稳用上两年的大厂 CTO 们——汇报 PPT 还没在董事会上播放完,老黄又掏出了 Vera Rubin。