刚刚发布的 GPT-6 Astra 居然刷出了 99.9% 的近乎满分!
如果你不了解 AI 行业,可能觉得这只是又一次常规的厂商刷榜;但只要你稍微懂一点 AI 评估,看到这个数字,后脊背绝对会泛起一阵冷汗。
因为图里这个 ARC-AGI(抽象与推理语料库)被称为 AI 界最残忍的“赛博试金石”。
平时我们看到的各种高考题、文史常识、编程竞赛,本质上都是在比谁的记忆库大。大模型只要在几万亿 token 的训练集里见过了相似题型,就能靠“背诵全文”对答如流。这叫“晶体智能”,说白了就是当顶级做题家。
但 ARC 测试完全不按套路出牌。它既没有文本说明,也没有参考答案,更没有可以在互联网上抓取的现成数据。它给 AI 的,是一堆完全没有规则提示的彩色方格阵列。
这就好比直接把一个没有说明书的隐形迷宫扔给你:你按一下红按钮可能喷火,按两下绿按钮可能开门,你必须在没有任何指导的前提下,靠试错、摸索、总结,自己找出背后的宇宙逻辑,把关卡过掉。
这就是心理学上讲的“流体智能”——面对从未见过的全新困境时,凭借纯粹的抽象逻辑与归纳直觉去破局的能力。这也是人类过去自认为超越机器的最后一块领地。
过去老一辈大模型在这个测试面前几乎全是“盲人摸象”。因为无论你的训练数据有多庞大,ARC 永远能用动态生成的未知规则把你卡在死胡同里。之前模型能拿个 30% 分数,背后的工程师团队都要开香槟庆祝;而人类普通受试者在这个测试上的平均分也不过 60% 到 80% 左右。
现在,GPT-6 Astra 在第三代 ARC 测试里直接轰出了 99.9%。
这意味着什么?这意味着机器不仅看懂了游戏,它甚至在没有说明书的前提下,把设计关卡的人给“降维打击”了。它不再是那个靠大数据喂养出来的知识搬运工,而是进化出了真正的自主推理与法则归纳能力。
如果这个成绩在严苛的防泄题机制下是真实的,那么整个科技界乃至现实社会的底层逻辑都将被重写。
这意味着,如果把这套智能投放到现实中:把它扔进未知的蛋白质折叠结构里,它能自己摸索出新的生物学规律;把它扔进海量的未知物理实验数据里,它能超越人类物理学家直接推演出新公式;把它扔进复杂的金融波动里,它能在所有人懵逼的时候秒懂市场的隐藏规则。
以前我们总安慰自己:“AI 只是机械地模仿人类,它根本没有真正的思考。”
但当一个机器在完全无规则的赛博黑盒里,用比人类快成千上万倍的速度自主摸清规律并破局时,再去纠结它“算不算思考”,就如同当年纠结“火车跑得比马快算不算真正的奔跑”一样可笑。
依靠记忆力通关的做题家时代结束了,掌握“发现规则”能力的机器正推门进来。
人类文明几千年积累的经验教条,原本是我们最骄傲的护城河;而当机器学会了“在没有任何规则的地方建立规则”,真正的文明拐点,可能真的到了。
