发布24小时不到,Arena.ai前端代码竞技场的排行榜出现了过去两年从未有过的画面:第一名,kimi-k3,1679分。第二名,claude-fable-5,1631分。第三名,gpt-5.6-sol,1618分。一个中国开源模型,把当前领头的两个美国闭源旗舰压在了下面。
核心能力2.8万亿参数是什么概念?目前排名最高的开源模型DeepSeek V4 Pro是1.6万亿,K3直接高出了75%。
但参数不是唯一的衡量标准,K3真正值得关注的是几个具体的能力:原生视觉理解,K3可以边看截图边改代码。它不是把视觉当附加能力,而是把看到的内容实时纳入编程循环。做前端开发、游戏开发、CAD工作流时,这意味着它能自己看到渲染结果,然后决定下一步改什么,不需要你把问题反复解释一遍。
100万token上下文,大约相当于一次性处理75万个单词,足以容纳一个完整的中型代码库、几本书的文献、或者一个长达数小时的会议记录。而且K3专门针对长程任务不掉线做了优化,不只是装得下,而是能从头看到尾还记得前面说了什么。
前端代码全球第一,Arena.ai的WebDev排行榜用的是真实开发者的盲测投票,同一道题交给两个匿名模型,用户用之后投票,投完才告诉你选的是谁。在这个最难被品牌效应干扰的测试里,K3从自家上一代K2.6的第18名,一跃到了第1名。
官方公布的六项编程评测里,K3、Fable5和GPT-5.6 sol分别占据两个榜单的榜首。
有一个细节在大多数测评文章里被忽略了,但很重要:评测结果附注里明确写着,Fable 5 的数据含potential fallbacks,GPT-5.6 Sol 的数据含cyberguards,而 K3 没有这两个标注,它跑出的是干净成绩。也就是说当 Fable 5 遇到它处理不了的任务时,可以触发备用方案;K3 没有,靠的是模型本身。
定价高,但对标的是谁说到价格,要先搞清楚K3在跟谁竞争。
K3的API输出价是¥100/百万token,比自家上一代涨了将近四倍。有人觉得贵,但这个贵是跟什么比的?如果跟DeepSeekV4比,确实贵很多。DeepSeek的定价策略是极致低价走量,两者根本不是同一个赛道。
就像你不会拿DeepSeek去问为什么比记事本贵一个道理,它们的目标场景不一样。
真正和K3竞争的是Claude Fable 5和GPT-5.6 Sol。这两个是目前综合能力排名全球前两位的模型。
K3的综合排名是第四,价格呢?Claude Fable5输出价约¥182/百万token,K3是它的55%。GPT-5.6Sol输出价约¥109,K3几乎持平。用接近世界第二的能力,付它一半的价钱,这才是K3真正的价格故事。
这件事更大的意义K3的发布不只是月之暗面推出了一个新模型。
去年这时候,没有人会认真讨论中国模型值不值国际顶级模型的定价,今天这个问题有了一个正式的答案。
Mozilla的CTO在接受采访时直接说了:现在这就是一个双边竞争的问题。
美国AI实验室的CEO们在华盛顿游说限制开源模型出口,而这个类别的领头羊,是中国公司。
你去游说限制的东西,一定是你觉得有威胁的东西。
有观察者算过:一年前大家说中美AI差距是6个月,半年前说3个月,现在最新的估计是1.5个月。
而K3的综合能力表现,是目前支撑这个差距在快速缩小判断最硬的证据之一。当然一次发布不等于持续领先,Fable 5.1据传已经在路上,GPT-6也比想象中近。
K3坐上第一的时间能维持多久,还要看接下来几个月。
但这件事本身的意义是清楚的:开源模型第一次具备了跟最强闭源模型正面叫板的能力,而做到这件事的,是一家中国公司。人工智能





