今年2月,谷歌DeepMind联合创始人德米斯·哈萨比斯在印度AI峰会上抛出一个想法:把一个大语言模型的训练数据截止到1911年,看它能不能自己推导出广义相对论。如果能,那会是对通用人工智能的一次有力测试。
这个想法听着就让人兴奋。1915年,爱因斯坦提出广义相对论,彻底改写了人类对引力和时空的理解。从黑洞到引力波,从宇宙膨胀到GPS卫星校准,现代物理学的半壁江山都建在这个理论上。如果AI能在不知道答案的前提下,从同样的线索里重新走出这条路,那它确实称得上拥有了某种意义上的智能。
很快就有人动手试了。
独立AI研究者迈克尔·赫拉用1900年以前的数据训练了一个模型,给它喂了一些关键线索。比如光电效应的实验观测,也就是光照射金属板时能打出电子的现象。这个实验后来被爱因斯坦用来提出光量子的概念。赫拉还给模型提供了爱因斯坦著名的电梯思想实验的核心要素,这个实验正是通往广义相对论的关键跳板。
模型偶尔闪过一点灵光。面对光电效应的数据,它说光“分裂成许多独立的脉冲”,隐约触到了光量子的边缘。但绝大多数时候,它只是在拼凑听起来合理的词句,内部并没有建立起任何关于物理世界的真实理解。赫拉的评价很直接:它在鹦鹉学舌。
另一个团队走了类似的路。独立计算机科学家尼克·莱文和同事试图用1930年以前的公开资料训练一个“复古”模型。理论上,这样一个“1930年的大脑”不应该知道图灵机、哥德尔不完备定理或中微子这些上世纪30年代才出现的东西。
结果训练数据漏得像筛子。你问它上世纪50年代发生了什么,它经常能答对。这个理应停留在1930年以前的模型,居然知道富兰克林·罗斯福当过美国总统,而罗斯福是1933年才上任的。原因不复杂:历史文献的时间标注本身就不精确,没法在某个年份干净利落地切一刀。
不过莱文对这条路仍然乐观。他认为,如果把训练数据截止到今年1月,模型也许能提出一个如今已知是在6月作出的发现。理由是数据量和算力足够大时,统计规律本身就可能把答案推到正确的附近。
瑞士苏黎世大学的团队走得更系统。他们做了一整个家族的历史模型,项目叫Ranke-4B,知识截止点分别设在1913年、1929年、1933年、1939年和1946年。团队成员、现任职于瑞士苏黎世联邦理工学院的经济学家丹尼尔·格特利希(Daniel Göttlich)坦言,可用的历史数据和算力远不够让这些模型达到现代大语言模型的水平,所以他们的目标务实得多:不看它能不能重现天才,只看输出里有没有未来科学进展的一丝痕迹。用他的话说,找的不是天才,是天才的火花。
MIT的计算机科学家森迪尔·穆莱纳坦做了一个更严格的实验,结果不太鼓舞人心。他和同事给一个轨道力学基础模型喂了一组合成数据,全部来自遵循牛顿力学的行星系统,然后看它能不能自己推出万有引力定律:两个物体之间的引力与它们的质量成正比,与距离的平方成反比。
模型没有推出来。它给每一个行星系统各编了一条不同的“引力定律”,每一条都是错的,而且错法各不相同。
谷歌DeepMind的研究员汤姆·扎哈维在一篇题为“大语言模型不会跳跃”的文章里点破了关键。从数据里总结出一般规律,叫归纳推理,这是AI的强项。爱因斯坦那种“为某个孤立现象发明一个原因”的推理,叫溯因推理,是一步创造性的跳跃。
爱因斯坦从等效原理出发,自由下落的人感觉不到自身重量,引力和加速度无法区分,没有去修补牛顿引力的细节,而是提出质量会让时空弯曲,并由此成功解释了水星轨道多年未解的异常进动。这种跳跃不是从数据中“涌现”出来的,是一次彻底的概念重构。
当前的大语言模型恰好在这件事上最弱。它们的工作原理是在海量数据中寻找统计关联,然后给出概率最高的回答。这让它们成了出色的预测工具,但科学史上的范式转换往往发生在数据稀少、现有理论解释不了异常的时刻。17世纪的开普勒根据第谷·布拉赫的精密观测数据,总结出行星运动的数学规律,牛顿再从这些规律里推出了万有引力定律和运动定律。这条从少量精确观测到普遍原理的路,至今没有AI走通过。
MIT的计算机科学家雅各布·安德烈亚斯指出了一个更深层的困难。大语言模型在理论上完全可能在输出中包含广义相对论的正确表述,问题是它同时也会输出无数条完全荒谬的理论,而它很难分辨哪一条是对的。在数学领域,每一步推导都能被即时验证,所以AI的进展更大:今年5月,OpenAI的聊天机器人推翻了匈牙利数学家保罗·埃尔德什一个80年未解的猜想,穆莱纳坦认为那是一次“真正的概念进步”。但解题过程中用到的核心思路,仍然来自已有的数学文献,算不上从无到有的创造。
以色列理工学院的量子光学专家伊多·卡米纳和同事在7月发布了一篇预印本(未经同行评议),标题就叫“AI能追随爱因斯坦的脚步吗?”。他们的结论是:AI做出类似级别的突破并非原理上不可能,但前提是重新审视当前模型的基本构建原则。不是把数据喂得更多、模型做得更大就够了,而是要在AI的思考方式上动根本的手术。
这场实验最有意思的地方,也许在于它揭示的不是AI离爱因斯坦有多远,而是爱因斯坦那一步到底有多难。111年前,一个26岁的瑞士专利局职员,手里只有几个让人困惑的实验结果,就敢把整个物理学的地基掀掉重来。今天最强大的AI,坐拥人类知识的绝大部分,却在同一道题面前交了白卷。
~~~~~~
图一:AI能像爱因斯坦那样想出广义相对论吗?,图源:Acapulco Studio图二:爱因斯坦广义相对论手稿的开头部分,图源:David Silverman/Getty
信源:Ball, Philip. "The Einstein Test: What Happens When AI Tries to Rediscover Relativity?." Nature Publishing Group UK, 9 Sept. 2026

