Agentic AI为何把内存推到系统吞吐的中心
信源:MOONSHOTS|Peter Diamandis、Alexander Wissner-Gross、Emad Mostaque等关于AI内存瓶颈的播客讨论|2026-08-22
MOONSHOTS这期关于内存瓶颈的讨论,留下了一条比价格数字更有解释力的系统逻辑:当模型权重、上下文和持续状态需要更频繁地进出计算单元,AI基础设施的有效产出会越来越取决于内存能否持续供数。峰值算力给出理论上限,容量、带宽和数据搬运成本决定这部分上限能兑现多少。
可用吞吐指系统在给定时间和资源约束下,实际完成了多少合格任务。增加GPU首先扩充计算侧;如果参数和状态无法及时到位,昂贵的计算单元就会等待。内存由此从容量配置问题,进入了系统效率问题。
Alexander Wissner-Gross在节目中解释,Transformer执行前向计算时,需要让相关层的参数能够被内存访问,再参与矩阵运算。同一期节目此前还讨论了稀疏模型和选择性激活。稀疏化可以减少每次任务实际调用的参数,却只是缩小需要搬运的数据集合,并没有取消内存访问。系统仍要足够快地找出并送达那部分数据。
HBM是当前应对这一约束的主要方向之一。节目将其概括为通过3D堆叠和更靠近计算的封装形态提高带宽、缩短数据路径。这个方向能减少等待,但内存和计算尚未完全融合,系统依然依赖复杂的堆叠、封装与互联。计算芯片越快,这些环节越容易从配套部件变成整机吞吐的约束。
节目内部对需求来自哪里并没有完全一致的答案。Diamandis强调持续运行的智能体需要保存用户交互和状态;Wissner-Gross认为,更大的存储对象仍是模型权重承载的世界知识。两种解释都会增加数据需求,却落在不同的内存层级。个体状态更可能推高分层存储需求,模型权重则更直接考验靠近计算的容量和带宽。
把这些需求压缩成一个内存增长结论,会掩盖容量、带宽、延迟和成本之间的取舍。Agentic AI带来的变化,更像是整个内存层级需要重新分工:高频访问的数据靠近计算,长期状态放在成本更低的层级,系统再决定何时搬运哪些内容。
采购和基准测试的比较单位也要随之改变。只看GPU峰值指标,会把等待数据的时间留在系统评价之外。更有意义的口径,是在同一工作负载、功耗和延迟目标下比较实际完成的任务量,再判断约束落在计算、容量还是带宽。
节目还给出了一些幅度很大的价格、需求和产能数字,但没有统一产品、单位、基准与起止期。这些口述信号可以说明市场正在感受压力,却不足以证明长期短缺或持续利润率。Wissner-Gross提出了另一层解释:内存行业经历过繁荣与衰退,厂商担心需求高点后的产能过剩,因此扩产不会随着新需求立刻增加。
AI内存因此同时受结构变化和产业周期驱动。模型与智能体推高数据访问,是结构性力量;谨慎扩产和节目所称的客户提前锁量,则可能放大阶段性紧张。技术重要性上升,并不保证所有内存厂商按同样幅度获利。利润能否留下来,要靠可交付产能和实际合同价格验证,这期节目没有足够数据回答。
当数据搬运成为约束,先进封装、互联和系统集成的重要性会随之上升。技术机制能够支持这层推演,商业收益最终仍取决于谁能稳定交付合格产品,以及替代方案推进多快。
节目讨论了另一条路径:把相对稳定的模型参数直接固化进芯片,或借助光子计算等架构减少数据移动。它们的共同目标都是降低搬运成本,却要承担灵活性代价。参数一旦固化,模型更新可能要求更换硬件,而现有制造体系很难追上软件模型的迭代速度。
内存的战略位置,来自它在高速变化的软件和缓慢改造的硬件之间提供了一层可更新缓冲。只要模型变化快于专用芯片的重制速度,系统就需要容量足够、带宽足够、又能随时替换内容的存储层。AI基础设施的下一轮效率竞争,会落在如何用更低成本,把正确的数据在正确时间送到计算单元。