昊梵体育网

梁文锋和马斯克对垒,DeepSeek V4 Pro给全球最强上压力

摘要:

过去,高性能模型遥遥领先,而即便是性能较差的模型也可能依靠低价拿下一定市场份额。但在DeepSeekV4系列、Gork4.6等主打性价比的高性能模型发布后,这种单纯的发展路线大概是要正式告吹了。

凤凰网科技出品

作者|Dale

编辑|董雨晴

酝酿了多时,DeepSeek最强模型终于揭开面纱。

8月12日深夜,DeepSeek官网API文档悄然换版——模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。

最先发现变化的依旧是开发者们。随后,一张评测对比表从DeepSeek官方群流出,AI圈的深夜被彻底点亮。

需要注意的是,备受关注的Harness依旧保持悬念。凤凰网科技检索平台信息发现,“DeepSeekHarness团队”公众号已于今年7月6日正式注册,公众号认证主体为“北京深度求索人工智能基础技术研究有限公司”。

8月1日,DeepSeek内部Harness团队负责人崔添翼曾面向全球公开征集Harness内测用户,优先筛选具备AgentHarness开源项目经验的开发者,申请人需提交代码托管平台账号与代表作品。

据测试过的开发者表述,“参与内测并深度体验2天后,我愿称DeepSeekHarness为宇宙最强”。

就在V4Pro正式发布六天前,DeepSeek刚宣布计划近期整体上调API服务定价,“预计涨幅较大”。而DeepSeekV4Flash的极致性价比,才刚刚在海外留下深刻的印象。

一边是性能追平全球顶尖模型,一边是预告大幅涨价。这家以性价比横扫市场的公司,正在讲述一个截然不同的新故事。

0.1分的距离,与全球最强模型厮杀

这张刷屏的评测表显示,TerminalBench2.1,一项衡量AI智能体在真实终端环境中完成复杂任务能力的测试,V4Pro正式版拿到87.9分。全球第一的AnthropicFable5是88.0分。差距只剩0.1。

作为参照,上一版V4Pro预览版的成绩是72.1分。三个月,有了15.8分的跃升。

此外,还有两项反超。在AI安全智能体基准Cybergym上,V4Pro拿到83.3分,以0.2分的微弱优势压过Fable5的83.1;在工作流智能体测试AutomationBench中,31.8分对29.1分,同样胜出。而在衡量软件工程能力的DeepSWE上,分数从预览版的12.8分跃升至62.7分,接近原来的五倍,超过了Anthropic上一代旗舰Opus4.8的58.0分。

需要说明的是,这些数据目前来自DeepSeek官方群及社区流传,官方尚未发布V4-Pro-0813的正式更新日志,严格来说应视为非官方披露。但多个信源交叉体验印证,提升幅度真实可感。

智能体是理解这次升级的关键词。与传统大模型比拼知识问答和数学推理不同,TerminalBench、DeepSWE这类测试考察的是AI能不能真正干活——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。

据DeepSeek官方API文档,V4Pro正式版支持1M(百万)Token上下文长度,最大输出384KToken,支持非思考与思考两种模式,并兼容OpenAI和Anthropic两种API格式。这意味着开发者几乎不需要修改代码,就能把原本调用Claude的应用切换到DeepSeek上。

这一次更新的时间点也非常有意思。就在V4Pro上线前几个小时,马斯克旗下SpaceXAI发布了Grok4.6,在面向真实知识工作的GDPVal-AAv2评估中以1753Elo登顶,超过Fable5的1741和GPT-5.6SolMax的1728。两款主打高性价比的模型同夜撞车,不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果。梁文锋与马斯克双强对垒,纷纷拿出兼具高性能与高性价比的产品,真正感到有压力的恐怕还是OpenAI与Anthropic。

目前,Fable5每百万输出Token定价50美元,GPT-5.6SolMax为30美元,Grok4.6为6美元,而DeepSeekV4Pro仅为0.87美元——约为Fable5的五十七分之一。

0.1分的跑分差距背后,是五十七倍的价格鸿沟。这个等式,足以让每一个开发者重新审视自己的技术选型。

一张涨价预告函的底气

此次DeepSeekV4Pro的性能表现,也在一定程度上解释了六天前涨价的底气。

8月6日,不少开发者登录DeepSeekAPI后台时看到一行提示:“计划近期整体上调DeepSeekAPI服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。”

这也是DeepSeek首次预告整体上调API价格,而非此前针对高峰时段的局部调整。

市场之所以震动,是因为DeepSeek过去一年的形象,恰恰是“价格屠夫”。

梳理其今年的定价时间线:4月V4发布时,V4ProAPI以2.5折优惠上线;5月31日优惠结束后,直接永久降至原价的四分之一,输入(缓存未命中)3元/百万Token、输出6元/百万Token,较首发价降幅达75%;6月29日又引入峰谷计费,工作日高峰时段价格翻倍。

从永久降价到预告大涨,中间只隔了两个多月。

DeepSeek当然有自己的难处。OpenRouter的数据显示,7月27日至8月2日当周,DeepSeekV4Flash以7.11万亿Token的调用量位居全球第一;另据开源项目OpenCode统计,仅8月1日一天,V4Flash处理量就达到8万亿Token。8月4日,该模型甚至因前所未有的访问量出现容量不足。

调用量是蜜糖,也是负担。每一次API调用背后都是真金白银的算力消耗,长时间低价跑量,持续吞噬的是现金流。

但如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。

一个容易被忽略的细节是:仅仅两个月前的6月16日,DeepSeek刚刚完成成立以来首轮外部融资,募资总额超过500亿元人民币(约74亿美元),投后估值突破500亿美元,创下中国AI行业单轮融资纪录。其中,创始人梁文锋个人出资约200亿元,为最大出资方。最新消息显示,DeepSeek已在推动第二轮保底100亿元的融资。

手握重金却选择涨价,这更像是一次主动的定价策略切换,而非被动的成本转嫁。

摩根士丹利8月9日发布的研报给出了三个驱动因素:其一,V4模型需求旺盛,支撑了更强的定价能力;其二,厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;其三,更多使用国产芯片可能带来更高的推理成本。

报告认为,模型智能,而非价格,才是大模型竞争的终极壁垒。当V4Pro在TerminalBench上距Fable5仅差0.1分时,DeepSeek已经有资格为这份“足够接近”收取溢价。

价格战的终局信号

DeepSeek的涨价,不是孤例。

把视野拉到整个行业,这条涨价曲线也已经浮现。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、MiniMax及DeepSeek为样本,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token,回升至2026年二季度的21.9元/百万Token。

拐点早已出现。今年一季度,智谱API定价较去年底累计上调约83%,但调用量反而增长了400%——量价齐升,说明开发者愿意为更强的模型付费。7月,月之暗面发布KimiK3后48小时内请求量超出预估,逼近集群承载极限,直接暂停C端新用户订阅以全力扩容。腾讯在3月至4月间两轮上调模型API价格,部分涨幅高达463%。MiniMax、阿里云等也相继收紧免费额度、调整计费方式。

据36氪报道,过去两年国内大模型赛道深陷Token价格厮杀,厂商靠压低接口报价抢占开发者与企业客户。但进入2026年下半年,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。

逻辑其实并不复杂。有行业分析指出,Agent任务的算力消耗是普通对话的十到一百倍,而当模型开始真正进入企业的生产流程——写代码、做分析、跑流程——客户对价格的敏感度会让位于对可靠性和能力的要求。智谱涨了83%依然供不应求,已经说明了问题。

摩根士丹利将其概括为一个飞轮:更强的模型带来更多收入,更多收入支撑更大投入,更大投入再次推高模型能力。头部厂商可以随时推出低价轻量版本覆盖大众市场,但中等厂商想要向上突破至顶尖水平,难度完全不在一个量级。

这或许才是DeepSeek深夜换版的真正注脚。它先用V4Pro证明自己“能干活”,拿到了与全球顶尖模型同台竞技的入场券;再用一纸涨价预告,测试市场对“中国智能”的支付意愿。

当然,考题也随之而来。涨价之后,那些对成本极度敏感的中小开发者是否会迁移?“涨幅较大”究竟是多大?在Grok4.6等同梯队选手仍以低价猛攻的背景下,DeepSeek的定价权能维持多久?

这些问题,会在涨价正式落地后才能回答。但有一点可以确定:当最擅长打价格战的玩家开始收枪,中国大模型行业的竞争逻辑,已经翻过了一页。

(本文题图为AI生成)

评论列表

用户12xxx75
用户12xxx75 2
2026-08-13 17:58
峰哥,硬抗美国就靠你们了![点赞][捂脸哭][滑稽笑]

ZZ newchn 回复 08-13 20:40
👍👍

陆地真人
陆地真人 2
2026-08-13 20:20
老大与老二打架,老三消失了!