昊梵体育网

智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下: Kimi K3和GLM-5.3并列60分,是中国唯二能过挤进T1阵营里的模型,咬住了GPT-5.6和Claude Opus 5,当然Kimi K3是已经发布超过1个月了,含金量更高。 T2档位排下来依次是58分的Qwen3.8 Max、53分 ​

智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下:

Kimi K3和GLM-5.3并列60分,是中国唯二能过挤进T1阵营里的模型,咬住了GPT-5.6和Claude Opus 5,当然Kimi K3是已经发布超过1个月了,含金量更高。
T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。
T3则属于上桌吃饭的底线,有45分的MiniMax-M3、43分的小米MiMo-V2.5-Pro、42分的腾讯Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。
再往下数,T4就很深海了,蚂蚁Ling 3.0 Flash是38分,美团LongCat 2.0是34分,阶跃Step 3.7 Flash是31分,已经不太适用通用场景了,只能卖给垂直领域。
什么,你问22分的百度文心模型是不是位于马里亚纳海沟?
好吧,我稍微说句公道话,自从文心5.0拉了这坨大的之后,百度就没有再把新发布的文心5.1上传AA竞技场了,所以22分虽然不是百度的真实表现,但一个小版本的迭代估摸着也好不到哪里去。
对了,字节也没有在AA竞技场上传Seed参展,就憋大的吧。