✨ 我们谈论 AI 芯片时,往往把核心问题看作是它们进行数学计算的速度有多快。
✨ 但对于相当一部分推理来说,尤其是在 token 生成阶段,更困难的问题在于如何足够快地将足够的数据输送给算术单元。
✨ 一个 LLM 请求内部隐藏着两个截然不同的阶段。Prefill 负责处理 prompt,并能利用大量的并行计算。Decode 则逐个 token 生成回答,不断重复读取模型权重和 KV-cache 状态。英伟达将现代模型上的 decode 描述为从根本上受内存子系统限制,这也是为什么 Rubin 将每颗 GPU 的 HBM 带宽推高至 22TB/s。
✨ 这就是为什么 HBM 成为了 AI 技术栈中如此重要的战略环节。容量决定了你能在近端保留多少模型和缓存状态。带宽决定了这些状态向处理器输送的速度有多快。当计算引擎在等待数据时,更多的 FLOPS 并不能带来太多改善。
✨ 从经济角度来看,有趣的是这让软件对硬件产生了一种奇特的杠杆效应。量化、KV-cache 管理、批处理、投机解码以及更优的模型架构,都可以提高固定数量的昂贵芯片所产出的有效推理量。
✨ 因此,实际上只有两种途径来获取更多 AI 容量:部署更多硬件,或者让硬件减少等待时间。