9月1日,Anthropic发布了新一代旗舰模型Claude Fable 5.1,以及面向受信科研用户的Mythos 5.1。Anthropic给它的定位是"全球最先进的编程和知识工作模型",多项基准测试超越上一代Fable 5和OpenAI的GPT-5.6 Sol。
听起来像是又一次常规的"我比你强"的模型升级?不完全是。这次发布传递出的真正信号,不在性能数字里,而在一个容易被忽略的词上:成本。
一、性能确实强,但更重要的是"变便宜了"

先说性能。Fable 5.1在Terminal-Bench-Science 0.1基准上拿到52.6%,是Fable 5(24.7%)的两倍多,也超过了Opus 5的29.0%和GPT-5.6 Sol的22.4%。在Terminal-Bench 4.0上,Fable 5.1达到55.8%,Mythos 5.1更是达到60.9%。CursorBench 3.2.0上拿到73.4%,Humanity's Last Exam拿到60.9%(不用工具)到65.0%(用工具)。
这些数字确实刷新了大模型能力的天花板。但真正值得注意的是定价策略的变化。
Fable 5.1的基础输入和输出价格没有变,分别是每百万Token 10美元和50美元。但缓存读取价格直接砍了75%——从每百万Token 1美元降到0.25美元。这导致典型工作负载的实际使用成本比Fable 5降低约25%,高度智能体化任务的成本降幅最高可达45%。
用大白话说:模型变强了,用起来还更便宜了。
二、大模型竞争的重心正在转移这一点才是最值得关注的行业趋势。过去两年,大模型公司竞争的核心叙事是"我的参数更大、我的基准分数更高"。从GPT-4到Claude 3到Gemini,每家都在比拼谁先刷新榜单。
但到了2026年下半年,情况变了。头部模型之间的能力差距在缩小——你比我高2分,我比你高3分,这种差距对终端用户的实际体验影响越来越小。与此同时,企业客户开始问一个更现实的问题:跑完我那批真实任务,账单是多少?
这和云计算的发展路径非常相似。AWS早期比拼的是谁的服务更全、性能更强,但到了成熟期,竞争的核心变成了谁的成本更低、谁的计费更透明。大模型正在走同样的路。
Anthropic这次把缓存读取降价75%的策略,本质上是在告诉开发者:你们大量重复调用的场景,成本可以大幅降低。这是在抢企业客户的心智——不是"我最厉害",而是"我最划算"。
而且Fable 5.1的发布时间也很微妙。有报道称Anthropic计划在9月底登陆美股市场,有望刷新SpaceX创下的最高IPO募资纪录。在IPO前发布一款"更强更便宜"的旗舰模型,既展示技术实力,又展示对客户成本的重视——这是一份给投资者的叙事。
三、Fable和Mythos:同一个模型的两副面孔Fable 5.1和Mythos 5.1本质上是同一个底层模型,只是安全防护等级不同。Fable 5.1面向所有用户开放,Mythos 5.1仅限美国企业及受信访问计划中的个人用户使用。
Mythos 5.1的安全限制更少,允许在网络安全和生命科学等高风险领域做更前沿的科研工作。比如,Anthropic推出了生命科学验证计划,允许研究人员利用Mythos 5.1在生物学领域的高级能力开展科学研究。
有意思的是,两个模型在Terminal-Bench 4.0上的分数差异——Fable 5.1为55.8%,Mythos 5.1为60.9%——直接展示了安全防护机制对模型能力的影响。这是非常诚实的披露:你看,加了安全限制,能力确实会损失几个百分点。
四、网络安全:从"不让你碰"到"帮你找漏洞但不帮你利用"Fable 5.1在安全方面有一个重要变化。以前,AI模型在处理网络安全任务时,经常会出现"误报"——把合法的安全研究也当成潜在攻击给拦了。Fable 5.1改进了这一点,Anthropic称网络安全相关的误报减少了约60%。
具体来说,Fable 5.1现在可以用于发现软件漏洞,但不会协助开发针对这些漏洞的利用程序。也就是说,AI可以帮你找到代码里的安全漏洞,帮你修,但不会帮你写攻击这些漏洞的代码。
这个平衡很微妙。在网络安全领域,攻和防往往是一体两面——你要防住一个漏洞,往往需要理解怎么利用它。但让AI能够自主生成漏洞利用代码,风险太高。Anthropic选择了一个相对保守的路线:帮你防,但不帮你攻。
五、AI水印来了:内容溯源从倡议变成标配

另一个容易被忽略但影响深远的细节:Fable 5.1为Claude生成的所有文本加入了不可见水印。Anthropic正在以私人预览形式推出相应的检测API,根据欧盟法律要求,符合条件的机构可以使用这项API。
这意味着什么?意味着AI生成的内容将自带"身份证"。对于内容平台、媒体、教育机构来说,这是他们一直呼吁的东西。对于AI公司来说,主动加水印也是一种自我保护——在监管到来之前先做好自律。
当然,水印技术的实际效果还需要验证。如果水印太容易被去除,就形同虚设;如果太重,可能影响生成质量。但方向是对的——在一个AI生成内容泛滥的时代,溯源能力不是可选项,而是必选项。
六、三个破坏性变更:开发者注意对于实际使用Claude API的开发者,Fable 5.1带来了三个重要的破坏性变更。
第一,强制工具调用(forced tool use)被移除了。设置tool_choice为any或tool会返回400错误,需要改用auto+strict tool use或structured outputs。
第二,思维块(thinking blocks)与模型绑定。Fable 5.1可以读取早期模型的思维块,但早期模型不能读取Fable 5.1的。这意味着路由器和降级方案在切换模型时会丢失推理链。
第三,编辑早期对话会 invalidate 思维块。如果你在对话中途注入或删除提醒,或者重建system或tools数组,会直接报错。
这三个变化说明什么?说明Anthropic正在强化模型的"思维完整性"——模型在推理过程中的中间步骤不应该被随意打断或篡改。这是为长程Agent任务做准备,因为长时间自主任务需要模型保持连贯的推理链。
七、大模型竞争的下半场回到行业层面。Fable 5.1的发布标志着大模型竞争进入了一个新阶段。上半场比的是"谁更聪明",下半场比的是"谁更有用更便宜"。
这个转变对整个AI产业都有深远影响。当模型能力趋于均衡、价格成为主要竞争维度时,拥有最大算力规模、最低推理成本的玩家将占据优势。这可能反而有利于英伟达——因为所有人的模型都要在它的GPU上跑。
但对创业公司和中小企业来说,这是好消息。模型变便宜了,用得起AI的场景就更多了。此前因为Token费用太贵而搁置的视频审核、安防回溯、赛事集锦、课程检索等应用,可能重新进入可做区间。
Anthropic这次发布的核心信息其实很简单:AI最强大脑也开始讲性价比了。当一个行业从追求绝对性能转向追求性价比时,往往意味着它正在从"前沿科技"变成"基础设施"。大模型,正在成为水电煤。