企业级 Agent 工作流与推理算力周报|2026年8月24日—8月30日
本周最大的结构性变化,不是 Agent 又多了几个功能,而是产业开始围绕“Agent 是一种长期、并发、对延迟敏感且成本高度波动的生产负载”重新设计整个基础设施。企业侧出现更扎实的生产率案例,云厂商开始提供专门的 Agent FinOps,NVIDIA 和 OpenAI 则同时把芯片设计目标从单纯 tokens/s 推向“长上下文、多步骤 Agent 每单位电力完成多少有效工作”。这使此前的判断进一步强化:AI 基础设施的最小经济单位正从 Token 迁移到 Completed Task。
一、企业采用:从“工程师用AI”开始变成“整个组织都能生产软件”
OpenAI 8月26日披露 loveholidays 的生产案例,是本周最值得关注的企业端数据之一。一年内,该公司 AI-assisted code changes 从 7%升至79%,AI辅助部署频率提高 73%,但工程团队人数基本没有增长;Data Platform 的AI辅助变更成功率从58%提高到93%。更重要的是,产品经理、设计和商业团队已经可以直接借助 Codex 修改应用和基础设施,Agent开始把原本封装在工程师内部的专业能力变成企业公共能力。 OpenAI:loveholidays Codex案例
这个案例的意义并不是“程序员效率提高73%”,而是一个工程团队可以服务更大的组织需求,而不用按比例增加人头。Agent真正的ROI开始从“节约几小时”转向“扩大组织产能边界”。这会推动单用户调用深度继续增加,因为非技术员工开始间接调用代码、数据库、基础设施和内部工具。
二、Token与长任务:本周没有新的全行业Token统计,但基础设施已经开始为“爆发式Agent用量”定价
Google Cloud 8月26日发布专门针对Agent workload的FinOps体系:企业可以设置AI月度硬预算、估算 Agent runtime cost、监控异常成本激增,并将普通席位、开发Agent和自定义Agent额度放入统一池。更有意思的是,Google准备推出 Deferred Execution:不要求实时完成的Agent任务可调度到低峰时段运行,推理成本最高可降低约50%。 Google Cloud:Agent FinOps与成本控制
这是一个非常强的需求侧信号。传统SaaS按Seat收费即可,而Agent现在必须同时提供 Seat + Pay-as-you-go + Runtime estimation + Budget cap + Off-peak scheduling。原因是不同员工的AI消耗差异越来越大,而且技术团队的Agent负载明显呈突发式。也就是说,企业采用障碍已经从“模型效果”进一步迁移到成本不可预测性。未来应重点跟踪的不是平均Token价格,而是:
Agent总成本=并发Agent x 任务时长 x 推理/工具调用 x 失败与重试率
三、硬件范式:GPU之外,CPU、低延迟推理芯片和网络开始被Agent重新定义
8月24日NVIDIA在Hot Chips披露的Vera Rubin路线,是本周最重要的硬件信号。NVIDIA明确表示,Agent正在生成更多Token、处理更长Context,并且越来越多地与其他Agent协作。Groq 3 LPX已经进入量产,在一个100K Token长上下文Agent场景中达到3,400 output tokens/s;Rubin GPU负责大规模Context处理,LPX专门承担低延迟Decode。
更重要的是CPU。NVIDIA把Vera直接定义为面向Agent的CPU,因为 orchestration、tool use、code execution、data processing、simulation 都是CPU密集型任务。8月26日AWS进一步确认将引入Vera CPU,同时计划在2027—2028年额外部署 200万颗NVIDIA GPU;AWS明确指出,这些容量将服务Agentic AI、企业自动化、科学计算和Physical AI。 AWS与NVIDIA 200万GPU扩容计划
因此,CPU逻辑继续上调。Agent不是一次模型前向传播,而是“GPU推理→CPU工具执行→数据库/网络→再次GPU推理”的循环。GPU越快,如果CPU、runtime和数据访问跟不上,GPU闲置越严重。
四、ASIC:OpenAI第一次给出了自研推理芯片的实测结果
OpenAI 8月25日公布首颗自研推理芯片 Jalapeño 的测试:在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T等模型上,其峰值性能/瓦提高约 1.5—1.9倍,端到端延迟降低 1.7—3.6倍。OpenAI特别强调,Agent包含大量串行步骤,因此微小延迟会沿任务链累积;芯片设计目标因此不是单一FLOPS,而是同时优化Prefill、Decode、KV Cache、本地数据移动、网络和功耗。 OpenAI Jalapeño实测结果
这进一步强化ASIC判断:Agent workload规模越稳定,CSP和模型厂商自研Inference ASIC的经济性越高。 NVIDIA依然掌握通用性和完整系统优势,但未来大量Execution Token会持续向专用硅迁移。
五、HBM、网络、存储、电力:价值继续向整个“Agent Factory”外溢
NVIDIA本周甚至新增了“Scale-In”概念:Agent持续访问数据、存储和服务,使传统北南向网络不再够用;BlueField-4开始专门承载安全、Storage Access、Telemetry和Infrastructure Operations。Spectrum-X Multiplane则可以在不增加第三层网络的情况下扩展至 51.2万GPU。这说明Agent带来的数据移动已经从GPU互联进一步外溢到存储网络、服务访问、Agent-to-Agent通信和安全基础设施。
HBM仍处于最高景气区间。NVIDIA Q2数据中心收入达到 890亿美元,同比增长117%,同时Rubin已经全面量产;公司还明确推进包含CPO的Spectrum-6、Vera CPU、LPX以及BlueField-4。更值得注意的是,NVIDIA已经开始主动锁定土地、电力和数据中心Shell Capacity,并计划联合金融机构撬动超过5000亿美元第三方AI基础设施资本。
这意味着下一阶段瓶颈已经越来越不是单颗GPU,而是:
GPU/ASIC → HBM → CPU → Network → Storage → Power → Cooling → Site。
六、本周产业链判断
环节 景气度 本周变化 核心判断GPU ★★★★★ 维持 AWS 200万GPU扩容,Agent推理继续拉高总ComputeASIC ★★★★★ 上调 OpenAI Jalapeño验证低延迟、低功耗推理ASIC经济性HBM/DRAM ★★★★★ 维持高位 长Context、并发Agent和KV Cache继续提升容量/带宽需求CPU ★★★★★ 上调 Vera正式围绕Agent orchestration和tool execution定位网络/光互连 ★★★★★ 上调 Multi-Agent与Scale-In把网络需求扩展到存储和服务层企业级SSD ★★★★☆ 维持 Persistent memory、Agent日志、KV层级化继续增长电力/散热 ★★★★★ 上调 扩容已开始受土地、电力与基础设施建设速度约束Agent Runtime/FinOps ★★★★★ 显著上调 企业开始需要运行时成本、预算与调度控制
最终判断
本周最大的变化可以总结成一句话:
Agent正在从“软件功能”变成一种新的数据中心Workload Class。
过去评价AI服务器看 tokens/s;进入Agent时代,更合理的指标越来越接近:
Successful Completed Tasks / Dollar x MW
因为一个Agent任务真正需要共同优化的是Planning latency、Decode latency、CPU工具执行、KV Memory、网络数据移动、存储访问和电力效率。
下周最值得继续验证六个指标:每用户并发Agent数、长任务平均持续时间、每任务模型/工具调用次数、Frontier Model与小模型/ASIC的流量分层、Agent runtime成本增速,以及CPU/HBM/网络在单个Agent任务成本中的占比变化。