昊梵体育网

DeepSeek V4 Pro正式版测评出来了,SuperCLUE总榜第二,13个国产模型同台竞技。 最猛的是智能体编程,从预览版47.37分直接飙到63.16分,涨了近16分。幻觉控制也从79.70涨到89.73,靠谱多了。 横向对比Qwen3.8 Max,幻觉推理这块DeepSeek更优,但

DeepSeek V4 Pro正式版测评出来了,SuperCLUE总榜第二,13个国产模型同台竞技。

最猛的是智能体编程,从预览版47.37分直接飙到63.16分,涨了近16分。幻觉控制也从79.70涨到89.73,靠谱多了。

横向对比Qwen3.8 Max,幻觉推理这块DeepSeek更优,但智能体任务规划还差5分左右,指令遵循也有小幅下滑——看得出来团队这次把筹码全押在编程和长链路Agent上了。

有意思的是,刚涨完API价(最高11倍),转头就拿了个总榜第二。一边收刀涨价,一边亮肌肉,梁文锋这算盘打得我在杭州都听见了。

不过这测试是纯文本场景,多模态还没算进来。而且有博主测了个叫J-Space的插件,号称能让V4 Pro超过Fable 5,结果社区复测直接翻车——分数没涨,token倒多花了不少,作者还删质疑帖。

所以榜单归榜单,实际用起来好不好使,还得自己跑两圈才知道。

你们平时用DeepSeek写代码吗?跟GPT和Claude比觉得咋样?