Kimi K3 发布整体智能水平仅次于Claude 5.5和GPT-5.6 Sol。Coding依然是重点方向 ,尤其是在长时程软件工程任务上进展较大。整体来看,K3在各项分数上的进步很快,进一步缩短了与海外领先模型之间的差距。K3参数规模2.8万亿,目前是开源模型中参数规模最大的 。架构上,K3基于KDA(线性注意力)和Attention Residuals(残差优化、训练稳定),这两项技术都来自Kimi过去一段时间的技术更新,说明大模型迭代仍然需要长期、连续的技术积累。K3支持100万Token上下文,具备原生多模态理解能力。MoE方面,专家数量进一步提升至896个,每个Token只激活16个专家,对应激活率约为1.79%。