昊梵体育网

DeepSeekV4正式版发布!符合预期!国产在进步 🔥 DeepSeek-V

DeepSeekV4正式版发布!符合预期!国产在进步
🔥 DeepSeek-V4论文重点:百万Token如何实现?

DeepSeek发布了V4技术报告,重点介绍模型架构、训练方法和长文本效率。

🔥 两款MoE模型
V4-Pro:总参数1.6T,每个Token激活49B。
V4-Flash:总参数284B,激活13B。
两款模型均支持100万Token上下文。

🚀 混合注意力
V4采用CSA和HCA:
CSA将每4个Token压成一个KV条目,再筛选相关内容。
HCA将每128个Token压成一个条目。
同时保留128-Token滑动窗口,处理最近的局部信息。

⚙️ 训练升级
V4继续使用DeepSeekMoE和多Token预测,新增mHC残差连接与Muon优化器。Flash使用32T Token预训练,Pro使用33T Token,训练长度从4K逐步扩展到1M。后训练阶段先培养数学、代码和智能体等领域专家,再通过On-Policy Distillation合并能力。

📉 推理效率
在100万Token下,与V3.2相比:
V4-Pro单Token推理FLOPs约为27%,KV缓存约为10%。
V4-Flash分别约为10%和7%。

🏆 评测结果
V4-Pro-Max取得Codeforces 3206分、LiveCodeBench 93.5%、SWE-Verified 80.6%。在部分代码和数学任务上接近领先闭源模型。

⚠️ 需要注意
百万Token窗口不等于能稳定记住全部内容。MRCR检索在128K后开始下降,Pro在8-needle测试中从128K的0.92降至1M的0.59。部分结果采用DeepSeek内部数据或评测框架,部分模型对比也存在缺项。

🔎 论文核心
DeepSeek-V4通过压缩注意力、稀疏检索、MoE和低精度计算,降低了长文本的计算与存储成本,主要面向跨文档分析、代码工程和长流程智能体任务。
DeepSeekV4 大模型 AI论文 长上下文