昊梵体育网

宣称“媲美”不假,但“媲美”的是DeepSeek的哪一款、哪个版本、哪个场景,这

宣称“媲美”不假,但“媲美”的是DeepSeek的哪一款、哪个版本、哪个场景,这里面的水分比太平洋还深。

先看韩国这边。LG发布的K-EXAONE 2.0,7500亿总参数、370亿激活参数,确实是韩国最大的基础模型。24项基准测试平均分70.1,比上一代提升了10%以上。官方表示在指令遵循测试中与DeepSeek V4 Pro Max、Qwen3.5“性能相当”。SK电讯的A.X K2也宣称在数学和韩语测试中与DeepSeek-V4-Flash“相当甚至更优”。

但是,“相当”这两个字,得看跟谁比、比什么。

DeepSeek V4-Flash正式版,2840亿总参数、130亿激活参数,在Agent智能体终极测试中得分25.2,接近Opus-4.8的25.7分。而K-EXAONE 2.0的70.1分均分,据业内人士透露,DeepSeek同代模型的平均分已经突破78分。70分对标78分,这叫“相当”?

再看印度。Sarvam AI发布了300亿和1050亿参数的两款模型,宣称105B版本在多项基准上超越了DeepSeek R1(6000亿参数)和Google的Gemini Flash。但这里有个关键细节——DeepSeek R1是2025年初发布的推理模型,距今已近一年半。拿新模型对标人家一年半前的旧款,这操作怎么说呢……就像2026年的手机发布会上说“我们的跑分超过了iPhone 14”。印度韩国突然宣称有媲美DeepSeek大模型

更值得关注的是印度Alpie模型。官方宣称320亿参数,在GSM8K数学榜单上超过了DeepSeek V3。但开发者拆解权重后发现——该模型并非从零训练,而是在DeepSeek-R1-Distill-Qwen-32B基础上蒸馏量化二次开发而成。说白了,底座是人家的,自己只做了微调,然后宣称“媲美”——这不就是站在巨人的肩膀上说自己长得高吗?

数据不会说谎,但会挑着说。挑对自己有利的基准、挑比自己老的版本、挑特定的语言场景——这套路,在AI圈已经不是新鲜事了。