阿里通义Qwen3.8-Flash正式开源
IT时代网8月26日消息,阿里通义千问团队今晚正式发布Qwen3.8-Flash,同时开源Qwen3.8-Flash-Next的模型权重。Next新架构被视为全新一代Qwen4系列模型的雏形。
这是一个多模态MoE模型,主模型参数量125B,额外配备51B的N-gram Embedding,每token激活6B参数;原生支持262144 tokens上下文,并可通过YaRN扩展至1M tokens。新模型在四个方向做了系统升级:Attention层面采用GDN与QSA混合架构,前者负责高效压缩历史信息,后者通过轻量Indexer在micro-block粒度筛选重要上下文,显著降低长序列Attention开销;Residual层面引入Gated Residual机制,将残差流扩展为4条并行分支;Embedding层面引入51B参数N-gram Embedding,利用局部上下文查表扩展模型容量,相关参数可卸载至Host Memory,通过异步Prefetch与计算重叠,不长期占用GPU显存;Optimization层面采用Muon Optimizer,并针对正交化精度等策略优化。
性能与成本方面,相比Qwen3.7-Plus,Qwen3.8-Flash训练成本约为前者的九分之一,在编码与办公任务上能力更强。在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个取得最优结果。模型即将上线千问AI平台对外提供API服务,定价为每百万Tokens输入1元、输出3元;模型权重已于北京时间8月26日23:00在Hugging Face与ModelScope平台开源,并同步发布FP8量化版本。
注:本文综合自IT之家等,文中包含AI辅助创作的内容。
