昊梵体育网

好久没读过这么精彩的 Tech Report 了。

强烈推荐大家读一读 Qwen3.8-Flash 的 Tech Report,真的非常精彩。

我读完之后最大的感受是,它没有发明什么惊天动地的新架构,更像是把过去一两年模型领域里出现的重要新技术,以恰当的方式重新组合到一起,而且取得了不错的效果。看这个论文的过程,有点像新技术大阅兵。

Qwen3.8-Flash 当初的目标很明确,就是尽可能保持甚至提升模型的智能水平,同时大幅降低训练和推理成本。

所以最后这个模型主干参数是 125B,每个 Token 只激活 6B,另外还有 51B 的 n-gram Embedding 参数。

和上一代的 Qwen3.7-Plus 相比,它只用了大约 1/3 的激活参数、1/3 的训练 Token,所以整体训练 FLOPs 只有大约 1/9。

Benchmark 的表现上,Qwen3.8-Flash 在其中 8 项超过上一代 Qwen3.7-Plus,剩下 6 项的最大差距也只有 2.6 分。所以,它的智能水平还是相当不错。

我们可以把 Qwen3.8-Flash 的改造理解成四次比较大的手术。它们分别在解决四个问题:

1、Attention 成本太高,尤其是长上下文下的计算开销。
2、模型层数深了以后,前面的重要信息容易被后面的信息冲淡。
3、增加参数往往也会增加计算成本。
4、训练过程还会出现不稳定,训练效率也还有提升空间。