AI Agent的成本,首先由工作流决定
今天刷到一位开发者复盘自己的深度研究系统。他复盘了自己设计智能体的经历,发现智能体数量、运行时长和模型档次,都不能直接等于产出。一个任务如果分解过细、上下文反复复制、每个步骤都调用最贵模型,系统看起来很忙,实际是在用算力制造协调成本。
后来,他把搜索、核验、规划、工具执行和二次判断分给不同模型,共享已确认的信息,并把深度研究放到流程末尾,来优化工作流。
这说明,工作流本身,已经成为AI能力的一部分。
今年6月公开的一项智能体评测也给出了类似信号:使用同一个GLM 5.1模型,仅改变适配器设计,任务通过率就从19.1%升到73.4%;另一组对比中,模型选择带来29.4个百分点差异,工作流框架也带来27.4个百分点差异。模型很重要,如何组织模型同样重要。
过去大家比较单次调用价格、上下文窗口和榜单成绩,接下来更该看一元钱能交付多少经过核验的结果。便宜模型负责搜索和整理,强模型处理规划与争议,缓存复用稳定上下文,独立步骤核查数字和来源。省下来的往往不是某一次调用,而是大量重复阅读、无效分支和返工。
当然,多模型调度也可能变成新的浪费。所以,AI Agent进入生产环境后,真正稀缺的是把任务拆对、把证据验清、知道何时停止的人。评价智能体系统,最终要看可靠交付,而不是它调动了多少模型。
AI Agent成本由工作流决定
