7月31日下午,DeepSeek悄无声息地在API文档里更新了一行日志,没有发布会,没有通稿,甚至连个热搜都没买。但整个开发者圈子都听到了动静——V4-Flash正式版API,上线公测了。
Muse盯着那串基准测试数据看了两遍,说实话,有点离谱。Terminal Bench 2.1干到82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4……这组数字放在几个月前,那是妥妥的Pro级表现,现在被塞进了Flash这个后缀里。什么叫“Flash”?按DeepSeek一贯的命名逻辑,Flash就是那个快、便宜、甚至免费的版本。用Flash的身位打出Pro的分数线,这操作像极了当年小米把旗舰芯片下放到千元机上——不讲武德,但用户爱死。

最狠的一刀砍在哪儿?原生支持Responses API格式,还针对性适配了Codex。 这意味着什么?意味着你手上那些基于OpenAI生态写的代码、搭的Agent工作流,几乎不用改一行,换个Endpoint就能跑DeepSeek。迁移成本直接降到地板。对于那些被OpenAI高额Tokens费用压得喘不过气的创业团队和独立开发者来说,这不仅仅是“多了一个选择”,这是“终于有一家能替我把成本砍掉90%还不降性能”的救命稻草。
官方文档写得克制,“仅重新进行了后训练”、“模型结构和preview版一致”。但Muse读出来的信息是:DeepSeek在用正式版给市场吃定心丸。Preview版是给你尝鲜试错的,正式版才是能扛生产环境的。现在Flash先上,Pro正式版“尽快”发布——这个节奏很值得玩味。Flash先行铺量、建生态、绑开发者,Pro留在后面当“性能天花板”和营收支柱。一前一后,把开源社区的活跃度和商业变现的想象力都占了。

不过Muse得泼点冷水。公测≠无限制。Flash版虽然强,但正式版刚上线,稳定性和并发承载能力还需要时间验证。你拿它跑个自动化脚本、做个代码补全、搭个轻量级Agent没问题,但要是想直接把它当成核心交易系统的决策大脑,建议等Pro正式版出来再说。另外,官方明确说了APP和WEB端的模型没更新,也就是说你现在在网页版里聊天的还是老模型,想体验V4-Flash的威力,得去API playground或者自己调接口。这对纯聊天用户不太友好,但对开发者来说反而是个筛选机制——能折腾的留下,不能折腾的等着产品化。

还有一个细节,DSBench-FullStack 68.7、DSBench-Hard 59.6,这两个指标直指复杂工程能力。FullStack意味着它能从零构建一个全栈应用,Hard意味着它能在高难度约束条件下写出可用代码。结合Toolathlon verified 70.3的数据,V4-Flash已经不是那个只能陪你聊天的模型了,它是一个能干活、能调用工具、能自主完成多步任务的Agent底座。自动化测试、代码仓库理解、终端环境交互——这些才是Flash真正恐怖的地方。
回到那个问题:DeepSeek这波打的是谁的七寸?打的是那些靠API调用费躺着赚钱的闭源厂商。当一家中国公司能用Flash的定价提供Pro级的Agent能力,还把迁移门槛降到几乎为零,市场的天平就开始倾斜了。Pro正式版“尽快”发布这句话,与其说是安抚用户,不如说是给友商下的最后通牒。
Muse测评的判断是:2026年下半年,大模型竞争的主战场已经从“谁的参数大”转向“谁的API好用又便宜”。DeepSeek-V4-Flash这步棋,走得又快又刁。至于Pro正式版能不能延续这个势头,咱们等它“尽快”发布的那天,再拆开看。毕竟,闪电战之后,拼的是持久力。