阿里发布Qwen3.8Flash阿里推出全新多模态MoE模型Qwen3.8‑Flash,125B主模型搭配51B的N‑gram Embedding,推理阶段每token只激活6B,训练开销压缩到上代Qwen3.7‑Plus的九分之一。在成本大幅下降的前提下,编码、办公场景的能力还得到进一步强化。
这套架构把大模型降本这件事玩出新思路,用外挂Embedding扩充记忆,却不增加推理负担。不过纸面参数再亮眼,不等于实际业务就万无一失。MoE架构的输出一致性,长文档处理下会不会出现逻辑偏差,还是得靠开发者在真实业务场景里慢慢打磨验证。





