DeepSeek V4 pro 正式上线
刚看到 DeepSeek V4 Pro-0813 这张最新评测图。 我第一反应: DeepSeek 这次明显在猛补 Agent。 几个数据挺夸张: DeepSWE:12.8 → 62.7 CyberGym:52.7 → 83.3 DSBench-Hard:31.1 → 67.2 NL2Repo:38.5 → 61.5 Terminal Bench 2.1:72.1 → 87.9 尤其 Terminal Bench 已经到了 87.9,图里 Claude Opus 4.8 是 85.0,Fable 5 是 88.0。 AutomationBench 也到了 31.8,超过图里的 Opus 4.8 和 Fable 5。 当然,也没有到“全面碾压”的程度。 NL2Repo、Toolathlon、DSBench 等几个项目,Claude / Fable 依然很强。 但我觉得真正值得关注的是: DeepSeek V4 这一代的重点越来越清楚了:Agent、Coding、工具调用、长任务执行。 这和以前单纯比“聊天聪不聪明”,已经完全是两个阶段了。 对我们这种天天折腾 Codex、Claude Code、Coding Agent 的人来说,我现在更关心的也不是谁数学题多考了两分。 我关心的是: 能不能进仓库干活? 能不能连续跑几十步? 能不能调用工具? 能不能改完代码以后把测试跑通? 能不能真的把一个任务做完? 如果 V4 Pro 正式版实际体验能接近这张表的数据,接下来国产模型在 Coding Agent 这一块会非常有意思。 我已经准备等 API 更新后实际跑项目测一轮了。 Benchmark 看完只是开始,真仓库里跑一天才知道水平。 deepseekv4pro正式版

