昊梵体育网

8 月 13 日凌晨,DeepSeek 发布 V4 Pro 正式版,模型编号 V

8 月 13 日凌晨,DeepSeek 发布 V4 Pro 正式版,模型编号 V4-Pro-0813。API 文档已更新,价格不变:输入 3 元/百万 token,缓存命中 0.025 元,输出 6 元。

先看它自己跟自己比。预览版到正式版,十项 Agent 基准没有一项倒退。最猛的是 DeepSWE——考验长周期复杂软件工程的基准——从 12.8 分直接跳到 62.7,涨了近 5 倍。Cybergym 涨 30 分,AutomationBench 翻倍,Terminal Bench 2.1 从 72 到 87.9。

这意味着 V4 Pro 正式版不是微调,是在 Agent 能力上完成了一次质变。

然后看它跟谁比。对阵 Claude Opus 4.8,V4 Pro 均值 62.8 对 62.6,全面持平。对阵 Anthropic 最新旗舰 Fable 5:Terminal Bench 2.1 差 0.1 分(87.9 对 88.0),Cybergym 和 AutomationBench 直接反超,平均分 62.8 对 70.5,达到 Fable 5 约九成。

这是国产开源模型第一次站到全球顶级闭源模型的同一水平线上。

价格对比更直观。同样在 Terminal Bench 上跻身第一梯队,Fable 5 输出价 50 美元/百万 token,V4 Pro 输出价 6 元人民币。分数差 0.1,价格差 57 倍。

但有几个东西需要说清楚。

跑分是 DeepSeek 自己的 Harness 框架下测出来的。第三方口径没那么乐观:OpenRouter 援引 Artificial Analysis 的综合智能指数给 V4 Pro 打了 45.3 分,评级「优于 70% 的模型」,跟「追平 Fable 5」的官方叙事存在温差。独立验证还需要时间。

还有一个副作用:用户实测发现 V4 Pro 的思维链开始说「山顶洞语」——语法碎裂,词汇丢三落四,但意思还在。量子位的判断是这是为了压缩 token 消耗、优先保障 Agent 推理能力的取舍,写作能力可能受影响。

这次发布放在更大的背景里看:GLM 5.2 干到 Opus 4.8 级别,Kimi K3 逼近 Fable 级并引爆开源闭源论战,V4 Flash 把 API 调用成本干成电费。现在 V4 Pro 正式版来了,DeepSeek 的定位不再只是性价比——它直接盯着 SOTA 王冠去了。

还有一个信号:8 月 11 日前后,「DeepSeek Harness 团队」微信公众号完成注册,认证主体是深度求索。Harness 或即将发布。

DeepSeek发布V4Pro正式版DeepSeekV4Pro正式版DeepSeekHarness火了