昊梵体育网

三份模型榜单,三个不同冠军:以后我只信自己这100道题 上周一个客户开模型选型会

三份模型榜单,三个不同冠军:以后我只信自己这100道题
上周一个客户开模型选型会,负责人抱来三份报告,每份推荐的模型都不一样。会开了一个多小时,没结论。
会后他给我发消息:到底信哪个?
我说,都别信。你先自己测试一遍。然后我发给他一张表:一百道题,每题带标准答案和判分标准。三个候选模型,各跑一遍,把数字摆出来,再开会。
后来客户告诉我,他们开了第二次选型会,用了三十分钟选定了其中一款模型。
三份报告,为什么吵不出结果
不是报告收了钱。是公开榜单本来就不一致。
我把8月的几份榜单并排看。一份工具调用榜,Kimi K3以38.3分居首,GLM-5.3和GPT-5.6 Sol跟在后面。
BenchLM在8月24日的工具使用榜上,第一名是Qwen3.7 Plus,72分。换维度:GPT-5.2在多轮工具调用上98.7%,Gemini 3.1 Pro在跨MCP协调上69.2%领先,Claude Opus在标准工具使用基准上超过99%。
从这些数字可以看出,这是三套不同的考试,没有可比性。可比的是另一件事——每份榜单的冠军,都不是同一个模型。
榜单没有错。榜单展示的是模型在别人的考卷上的平均分。而平均分里藏着两件事:一,你的科目,可能不在卷子上;二,卷子一旦出名,题就漏了——模型会把名题带进训练管线,分数里掺着背题分。这事行业里叫基准污染,是公开的秘密。
榜单是否就不可信?那该信什么?
我的经验是:榜单只能作为一个参考。模型到底适不适合你,你要自己去测试,你要自己出张卷子,只信属于你自己的那张卷子。
那张卷子有个名字,叫评测集。它不考模型的平均水平,它考你的业务:你写得最多的那类文字,理得最多的那类表格,分得最多的那类工单,外加一些不常见案例。
客户第一次开会吵一小时,是因为所有人拿的都是别人的数字。第二次开会只用了三十分钟,是因为桌上是自己的数字:A模型总分91,但长文本类别只有63;B模型总分86,长文本88。他们的业务,恰恰最吃长文本。决定当场就做了。
所以,选型从来不是“谁更强”的问题,是“谁更配你”的问题。而“谁更配你”这个问题,只有你自己的卷子答得了。
有人会说,建评测集要一周,太慢。
再算算另一笔账:选型会一直空转,三份报告,五场会,最后靠投票拍板;选完发现不配,换厂商,时间已经过去一个月。评测集建的时候花一周,但它能复用:版本更新,跑一遍;换厂商,跑一遍;团队里有人想改提示词,跑一遍。
建评测集那一周看似多花了时间,但这个多花的时间是你的一份资产,是可以存下来复用的。从那天起,你公司里所有跟模型有关的决定,都有了一份共同的评判标准。
榜单是别人的考卷,版本号是别人的营销,评测视频是别人的口味。
只有你自己的评测集,才是唯一属于你的标准。
在这一波AI浪潮里,别人的结论对你而言,都只能作为参考;只有你拥有自己测试的能力,才是你的护城河。
评测集要怎么建、怎么标、怎么读分,可以看我之前的文章
AI智能体框架怎么选,建议看看这篇文章:
这是凯哥的每周真实记录之一,记录AI落地企业的真实过程,欢迎大家一起讨论交流。