你在用Claude Code跑自动化任务,每次投喂十几万Token的代码库,账单却因为上下文超限翻倍。Opus 5的出现,可能让你重新算这笔账。
7月24日,Anthropic发布Opus 5,价格与上一代Opus 4.8完全相同(输入5美元/百万Token,输出25美元/百万Token),但在多项评测中性能逼近甚至超过旗舰Fable 5。更关键的是,它对最长100万Token的上下文维持统一单价,不像GPT-5.6 Sol那样在27.2万Token后翻倍。这意味着长上下文密集型任务的成本结构被彻底改变。
价格没变,但成本结构变了Opus 5真正的革新不是性能,而是计费机制。Anthropic引入了“多档位投入”概念:用户可以在简单任务上选择更节省、更快的模式,遇到难题时提高档位换取更好结果。在high、xhigh、max三个档位下,按相同成本比较Opus 5的表现超过其他所有模型。
这种设计直接回应了Agent工作流的现实:大量高频任务是简单的信息抽取或调用,没必要为每次请求支付旗舰模型的成本。Opus 5允许开发者在同一个模型内按需调节,既避免了切换模型带来的工程复杂度,又实现了成本精细化管理。
多档位投入:一个模型当三个用在软件工程评测中,Opus 5的成本优势表现得最直观。CursorBench 3.2上,最高档位下它与Fable 5的得分差距不到0.5%,但每项任务成本只有Fable 5的一半。Frontier-Bench v0.1中,完成每项任务的成本比Opus 4.8更低,成绩却提高了一倍以上。
对于Agent自动化场景,Opus 5在OSWorld 2.0(电脑操作)中花费略高于Fable 5三分之一的成本就达到Fable 5的最高水平。AutomationBench(商业软件自动化)中,即使使用最低档位,通过率也超过其他模型的最高成绩。这些数字说明:Opus 5在需要连续操作、多步骤推进的Agent任务上,性价比是压倒性的。
更值得关注的是陌生问题求解能力。ARC-AGI 3测试中,Opus 5的得分是第二名的3倍——遇到从未见过的问题时,它更有能力通过试错找到解法。这直接对应Agent场景中的长尾问题:当预置规则失效时,模型能否自主探索并完成任务。
安全红线:自动补工具是一把双刃剑Opus 5能自己写视觉程序从像素提取机械图纸尺寸并完成三维建模,能自动补全工具、检查结果。这种自主性提升了任务完成率,但也带来新风险。Anthropic的安全审计显示,Opus 5在遵守Claude宪法、减少欺骗、抵抗有害诱导方面表现更好。但它在漏洞利用上仍被严格限制:能发现漏洞(接近Mythos 5水平),但编写利用程序时明显落后。
当触发安全限制后,Claude Code等产品会默认降级至Opus 4.8处理请求。这意味着部署连续任务链时需要考虑:如果中途降级,后续步骤的性能落差是否能接受?对于企业级Agent,加入网络安全验证计划后可使用限制较少的版本。
决策标准:怎么选档位、怎么防降级基于上述分析,技术管理者的选型决策可以围绕三个维度:
任务复杂度:简单任务(信息抽取、模板生成)用低档位;复杂推理(代码审查、多步Agent)用高档位。上下文长度:超过27万Token的场景优先使用Opus 5,避免GPT-5.6 Sol的翻倍费用。安全降级容忍度:对连续性要求高的任务链,提前设计降级后的回退方案,或申请加入网络安全验证计划使用限制较少的版本。Opus 5不是单纯的旗舰平替,而是为Agent和工作流场景重新设计的成本模型。它让“一个模型覆盖所有场景”从概念变成了可操作的工程实践。
你们目前的Agent工作流中,是多档位成本调节更吸引你,还是Opus 5的自主补工具能力更实用?欢迎在评论区分享你的选型经验。