Jalapeño为何重要:OpenAI正在把芯片变成模型迭代的一部分
信源:SemiAnalysis|《OpenAI Jalapeño: Better Than Nvidia Blackwell (Accelerators)》|2026-08-29
OpenAI第一代自研推理芯片Jalapeño最值得关注的,并不是某张性能图上暂时超过了Nvidia,而是它补上了“token经济学”里长期被低估的第三个变量:HBM容量决定系统能容纳多少模型权重与KV cache,HBM带宽决定decode的理论速度上限,架构和软件则决定这些资源究竟能兑现多少。Jalapeño显示,当模型开始参与RTL设计、kernel生成和性能搜索后,ASIC过去“开发慢、软件难、模型变化后容易僵化”的弱点,正在被显著削弱。自研芯片因此不再只是压低采购价格的谈判工具,而可能成为模型公司持续改善推理成本的一部分。
OpenAI公布的数据确实亮眼。在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三组公开模型上,Jalapeño在InferenceX测试中实现了约1.5—1.9倍的峰值单位功耗吞吐,并把端到端延迟降低至对照系统的约1/1.7—1/3.6。其额定功耗为700W,OpenAI称测试中的持续功耗不高于550W;芯片配备216 GiB HBM4和15.4 TB/s带宽。更关键的是,这些结果来自single-token prediction,没有使用多token预测,也没有采用prefill/decode分离。换句话说,它并非靠牺牲吞吐换低延迟,也没有只在高并发区间获胜,而是在吞吐—延迟Pareto曲线的多个位置同时前移。OpenAI的公开结果与Hot Chips披露的系统规格共同支持了这一点。
但视频标题里的“击败Nvidia”需要收窄。公开、可直接复核的比较对象主要是GB200和GB300,也就是Blackwell代产品;SemiAnalysis进一步拿Jalapeño与Vera Rubin在2026年7月的早期结果作了同开发阶段比较,并判断两者在单位电力吞吐和TCO上已接近甚至由Jalapeño领先。然而,SemiAnalysis也明确写出三项限制:所有原始数字由OpenAI提供,研究人员只在实验室现场确认了部分InferenceX运行;测试是相对容易优化的8k输入/1k输出单轮负载;更能反映长上下文、多轮工具调用、prefix cache与路由压力的AgentX尚未运行。因此,现阶段最稳妥的结论是“Jalapeño已经证明第一代ASIC可以在特定推理负载上进入一线”,而不是“OpenAI已经全面超越Rubin”。SemiAnalysis的原始分析对这些边界交代得很清楚。
Jalapeño为什么能做到这一点?答案并不在峰值FLOPS。其核心思路是减少数据移动和固定开销:把计算核心与HBM切成对应的局部slice,让每个核心优先访问自己的低延迟内存视图;常见的跨核心通信走专用collective network,复杂但低频的流量再交给通用NoC。较小的systolic array也更适合MoE和低并发场景中常见的“瘦矩阵”,避免大阵列因为维度不整齐、padding和tiling而大量空转。
它没有否定“推理即内存”,反而把这套逻辑从理论带宽推进到了有效带宽:HBM给出屋顶,数据本地性、同步开销与kernel质量决定系统离屋顶还有多远。
这也解释了为什么OpenAI强调“用AI设计芯片,同时把芯片设计成适合AI编程”。Jalapeño从RTL到tape-out约九个月,OpenAI称模型辅助带来了部分模块面积、时序与功耗改善;在软件侧,Codex把原本需要资深工程师逐行手调的mapping、placement、prefetch与pipeline搜索,变成了可以反复执行和验证的优化循环。
OpenAI披露,AI生成的部分attention和MoE block比现有专家实现快1.5—1.8倍,但这个数字只适用于选定模块,不能外推到整套模型。OpenAI的说明给出的证据边界很清楚:AI尚未独立设计先进芯片,但芯片开发中那些目标明确、反馈可验证、搜索空间巨大的环节,已经开始被模型压缩周期。
这会改变CUDA护城河的形态,但还没有消灭它。过去,替代GPU的最大难点往往是为不断变化的模型补齐kernel、编译器和运行时。若AI能把模型移植和kernel优化从多年压缩到数月,CUDA的软件迁移成本会下降。可Nvidia的优势并不只是一套编程接口,还包括通用训练能力、NVLink和网络、稳定量产、整机交付、故障恢复、开发者生态以及跨客户复用。
OpenAI现在拿出的仍是工程样片,正在做生产资格验证;官方计划在2026年底开始部署,产量爬坡则主要要看2027年。把三套测试模型跑快,与把数十万颗芯片稳定运行在百兆瓦乃至吉瓦级数据中心,是两个不同难度的问题。
Nvidia也没有停在Blackwell。就在OpenAI公布结果前一天,Nvidia发布了Vera Rubin在SemiAnalysis AgentX工作负载上的早期自测,声称单位兆瓦吞吐最高达到GB300的30倍,但该结果当时仍待SemiAnalysis审核,而且与Jalapeño的8k/1k测试并非同一模型、同一负载,不能直接横比。Nvidia的最新披露恰好说明,这场竞争比“GPU对ASIC”更复杂:双方都在把芯片、HBM、网络、KV cache、调度和功耗控制合成一个token生产系统,单卡规格表越来越难解释真实经济性。
因此,Jalapeño近期主要冲击Nvidia的利润池和客户结构,远未到需求崩塌的程度。OpenAI与Broadcom公布的是10GW自研加速器合作框架,同时又与Nvidia公布过至少10GW系统合作框架,并明确表示仍会大量部署Nvidia及其他伙伴的加速器。Broadcom公告与Nvidia公告放在一起看,更可能出现的分工是:Nvidia继续掌握训练、前沿探索和需要高度通用性的负载;模型公司把规模最大、模式更稳定、对成本最敏感的推理逐步迁入自研ASIC。前者守住技术前沿,后者切走最可预测的内部流量,并削弱Nvidia在大客户推理采购中的定价权。
产业链的价值并不会因为ASIC替代GPU而消失,只会迁移。Jalapeño本身由OpenAI定义架构,Broadcom承担硅实现与网络,Celestica参与系统集成;128颗ASIC组成机架内本地域,最多2,048颗芯片扩展到跨机架全局域,后者使用Tomahawk 6、1.6T光模块和光路交换。SemiAnalysis披露的系统拓扑表明,定制芯片减少的是商用GPU的品牌溢价,却把更多价值推向HBM4、先进封装、高速SerDes、Ethernet scale-up交换、1.6T光互联和整机工程。ASIC越贴近特定模型,系统集成反而越重要。
接下来最值得跟踪的是三项更硬的验证:Jalapeño能否在AgentX式长上下文、多轮agent负载下继续占据Pareto前沿;2027年的量产、良率、可靠性和部署速度能否支撑百兆瓦级运行;第二代芯片能否让模型—kernel—硬件的反馈循环持续快于Nvidia年度平台迭代。
只要其中任何一项长期失败,Jalapeño就可能停留在优秀但局部的内部加速器。若三项同时成立,AI芯片竞争的核心才会真正改变:领先者不再只是拥有最强单颗芯片的公司,而是最能把真实工作负载快速压进硅片、再把硅片稳定复制到整个数据中心的组织。