昊梵体育网

AI 考满分竞赛题,却玩不转小游戏,究竟是人造上帝还是人工智障?

五年前,有人脑洞大开想让 AI 写视频,放到现在就是个笑话。谁能想到,短短五年时间,AI 已经成了军事系统的核心参与者。

五年前,有人脑洞大开想让 AI 写视频,放到现在就是个笑话。谁能想到,短短五年时间,AI 已经成了军事系统的核心参与者。

chatGPT刚问世的时候,所有人都在惊叹AI的全能,甚至不少人把AI的任何回答都当成了标准的答案,就像是崇拜上帝一样崇拜AI。

但后来我们都知道了,AI也会出错,即使是一些非常简单的问题也是如此。

现在所有人都在纠结同一个问题:AI 什么时候能真正比得上人类?我们又该怎么判断它真的有了类人智能?

目前主流的 AI 通用智能测试,分成了好几种不同的方向。

第一种测试叫 “人类最后一场考试”,听起来挺唬人,其实就是 2500 道中学水平考题,覆盖数学、生物、社科等几十个领域,每一道题都是领域专家审核过的。想要通过考试,得能分类电环化反应、拆解蜂鸟骨骼、翻译古拉丁语,还要认得全古希腊神话里的所有角色。

去年这个测试刚出来时,主流 AI 模型的得分只有 8%,看起来还很鸡肋。但到了现在,它们的得分已经到了 35% 到 50% 之间,远超任何一个单个人能拿到的分数。可就算这样,也不算真正达到了人类智能。

举个例子,当被问到 “一只死猫被放进装着毒药瓶的盒子里,一小时后猫是活是死”,正常人类一眼就能看出来:猫从一开始就是死的。但像 GPT5.5 这样的顶级 AI,却会直接忽略 “死猫” 这个前提,按照训练过的薛定谔的猫标准答案来回答。AI 考满分微积分,却数不对 “草莓” 里的字母 r,这种反差特别明显。显然,光靠堆积知识,根本算不上真正的类人智能。

真正要测的,是 AI 能不能用抽象逻辑思考,真正理解问题的本质。ARC AGI 测试就是为此设计的,它用一系列谜题来考察 AI 在新场景下的逻辑适配能力。

比如一道简单的题:只给你红线上下两部分的图形示例,让你找出规律,完成最后一道题。正常人类看一眼就懂:擦掉红线上的所有内容,填上红线下的部分。但只要 60 秒就能做完的题,有一半的 AI 模型都没做对。

我们天生就知道 “上下”“内外” 这类概念,靠这些能力在现实世界里避坑、走路。但对 AI 来说,这些都是统计出来的数据,不是刻在脑子里的本能。连醉汉和小孩 10 秒就能解的题,AI 要花 2 万美元电费?

ARC AGI2 难度更高,规则是:没闭合的蓝色图形保持原样,闭合的蓝色图形内部填绿色、外部填红色。听起来不难,但截至目前,全球没有任何一个 AI 模型能做对这道题。这些 “闭合”“内外” 的概念,根本不是 AI 能自动理解的。截至目前,没有任何 AI 能做对这道抽象题

接下来的 ARC AGI3,测试方式更有意思:一堆没有操作说明的小游戏。比如移动箱子到指定区域、把粉色液体倒进洞里、走迷宫。你不仅要玩,还要自己摸索规则。

像这种需要判断 “橙色方块是帮手”“粉色液体是流体” 的逻辑,人类能轻松理解,但 AI 却做不到。Claude 仅通过 1.8% 的小游戏,其他 AI 直接卡壳。目前就算是表现最好的模型,也只能搞定不到 2% 的这类游戏。

说白了,现在的 AI 要么只会死记硬背知识点,要么连最基础的空间逻辑、游戏规则都搞不懂。距离真正拥有类人通用智能,还有很长的路要走。