看了一些glm 5.3的测评,好像都在说,glm 5.3碾压了deepseek v4 pro。
大厂的粉丝其实都是有脾气的。上次,deepseek v4 flash发布的时候,说v4 flash的能力在glm 5.2和kimi k3之间。这对glm 5.2是个羞辱啊。v4 flash都超过glm的旗舰。
所以glm 5.3报复回来了。
其实,现在看跑分意义不大。所谓后训练,搞不好就是刷benchmark。大家都来刷题,那么题就失去了意义。
什么terminal bench,livecode bench,这些测试已经是到了完全可以忽略的水平。因为这些老题,大模型可能直接都背过答案了。
比较有意义的,就是那些带live的题目,这些题是更新的。然而,题库更新的速度,未必赶得上大模型后训练刷题的速度。所以,最好的办法,搞不好就是随机出题。还有就是等大模型发布后再出题。
至于闭源模型,跑分对他们没有意义,可以一律视为作弊。因为今天题库更新,它有可能今天晚上就刷题,loRA,明天它们就可以刷出高分了。
所以自媒体博主们就别在整天傻呵呵的拿跑分骗人了。
当然,AI也不是完全无用,它还在快速发展之中。但是它并非万能。现在就有很多问题。