昊梵体育网

天亮了,部署正式版DS-V4-Flash-0731的成本真的不高! 这样的好模型

天亮了,部署正式版DS-V4-Flash-0731的成本真的不高!
这样的好模型应该人手一个[呲牙]

昨天已测试好最新正式版DeepSeek-V4-Flash-0731速度,但因为周末有事忙了,现在补发下,希望能给大家一个大概的运行感受。

这次跑的是unsloth的UD-Q8_K_XL,号称是无损失量化版,这里还是用我那台1W出头的AI主机进行测试。

1.一张3080
上下文处理即预填充prefill速度在250tok/s左右,生成速度~14.23tok/s,见图1

2.一张2080Ti
预填充prefill速度在80tok/s左右,生成速度~12.26tok/s,见图2
可以看到,2080Ti比3080在预填充速度prefill上差了不少,后面看看可有什么优化空间[捂脸]

3.两张3080
两张3080的话,预填充prefill速度在240tok/s左右,生成速度~14tok/s,见图3
还是跟上次差不多的情况,两张不如一张快,当然也差不了多少

通过简单测试了速度,发现这个正式版的DeepSeek-V4-Flash-0731确实跟之前的DeepSeek-V4-Flash架构是差不多的,采用了不同的后训练方法后,能力大增,DeepSeek、梁圣 牛[赞]

如果你有更好的显卡或硬件,速度还会更亮眼!

后面有空马上安排能力测试,欢迎持续关注!