【阿里正式开放Qwen3.8-2.4T-A95B模型权重 总参数达2.4万亿】阿里云“魔搭ModelScope社区”深夜宣布,阿里Qwen团队正式开放Qwen3.8-2.4T-A95B模型权重。这是Qwen-Max级别模型首次开源权重。Qwen3.8-2.4T-A95B是一个因果语言模型,总参数达2.4T,采用MoE稀疏架构,每个Token仅激活95B参数。模型每个MoE层包含512个专家,每个Token选择10个路由专家,并同时激活1个共享专家。上下文方面,原生支持262144 Token,并可扩展至1010000 Token。模型还进行了多步MTP训练。Qwen3.8延续Qwen3.5的混合架构,重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。官方公布的评测覆盖编程Agent、通用Agent、专业工作和长上下文等方向,与Opus 4.8、Fable 5、GPT 5.6 Sol等模型相比,在PaperBench、IFBench等基准测试中取得较高成绩。开源意味着开发者可以基于该模型进行复现、微调和二次开发。官方云端版Qwen3.8-Max基于该开放权重模型,并额外增加了多项生产环境能力。
【阿里正式开放Qwen3.8-2.4T-A95B模型权重 总参数达2.4万亿】阿里云“魔搭ModelScope社区”深夜宣布,阿里Qwen团队正式开放Qwen3.8-2.4T-A95B模型权重。这是Qwen-Max级别模型首次开源权重。Qwen3.8-2.4T-A95B是一个因果语言模型,总参数达2.4T,采用MoE稀疏架构,每个Token仅激活95B参数。模型每个MoE
阅读:0
点赞:0