“真的颠覆认知!北京协和医院神经外科住院医师、博士后金山木,在预印本平台发布论文,用 GPT-5.6-Sol 模型自主运行 16 小时,成功证明困扰全球数学界 22 年的 “克鲁泽猜想”。他本科读地质专业,数学全靠自学。猜想提出者本人及多位数学家核验后确认证明成立。白天做手术,晚上用 AI 攻克数学难题,这跨界,绝了。”
这段时间,这个消息同时炸了两个完全不搭边的圈子。
神经外科的同行们刷到消息,第一反应都是愣神。
大家印象里的金山木,天天泡在手术室做开颅手术。
这样一个临床医生,怎么突然就跑去纯数学领域搞研究了。
数学圈的教授们更懵,盯着论文作者单位看了好几遍。
北京协和医院神经外科,怎么看都和纯数学研究扯不上关系。
克鲁泽猜想算不上大众熟知的顶级难题,却是矩阵分析领域的硬骨头。
2004年,法国数学家米歇尔·克鲁泽正式提出这个猜想。
它讨论的是复方阵与多项式之间的数值约束关系。
核心结论是,矩阵多项式的范数上界,等于数值域波动的2倍。
这个表述看起来简洁,却难倒了全球数学界整整22年。
这个猜想不只是纯数学的文字游戏,还有很强的实用价值。
它和工程仿真、信号处理、医学成像等领域都紧密相关。
尤其是在非正规矩阵的计算里,这个常数是重要的安全边界。
能精准敲定这个最优值,很多实际工程计算都能更精准。
也正因如此,二十多年来才会有这么多学者持续攻关。
二十多年里,无数顶尖数学家都在啃这个硬骨头。
2007年,克鲁泽本人先证明常数为11.08时猜想成立。
之后各国学者不断收紧边界,一步步把数值往下压缩。
到2017年,学界把最优结果推进到了约2.414。
这个数字离最终的2,只差很小的一步。
可就是这最后一步,整个数学界卡了快十年,谁也跨不过去。
金山木和数学的缘分,走的完全不是常规学术路线。
他本科读的是北京大学地质学专业,和数学、医学都不沾边。
2019年他还去南阿尔卑斯山参与过地质考察。
2020年,他通过协和医学院“4+4”试点班转入临床医学方向。
之后一路读到医学博士后,成了神经外科的住院医师。
他的高等数学知识,全是靠工作之余挤时间自学来的。
接触到克鲁泽猜想,其实源于他的本职医学工作。
神经外科研究里,经常涉及脑部超声、神经信号的计算。
这些研究内容,大量用到矩阵分析相关的数学工具。
金山木在解决临床相关的计算问题时,摸着摸着。
就摸到了克鲁泽猜想这个领域前沿问题的边界。
他觉得这个问题有意思,就开始利用下班时间慢慢琢磨。
他不是那种一头扎进草稿纸里死算的研究者。
赶上大模型技术快速迭代,他开始尝试用AI做辅助工具。
但他的用法和大多数人不一样,不是问一句要一个答案。
他特意断掉模型的网络连接,不让它搜索网上的现成结论。
避免模型直接搬运已有成果,保证推演的独立性。
他给模型设置了多组不同的推理路径和切入角度。
让多个实例各自独立推进证明,互不干扰。
不同路径得出的结果,还要互相交叉核验、彼此挑错。
找对方的逻辑漏洞,挑证明里的瑕疵,甚至互相构造反例。
他还给模型设了死规则,没跑出完整自洽的证明,就不能停止。
整套程序启动之后,他就没再进行人工干预。
让模型按照设定好的规则,自己一步步推演试错。
整整16个小时之后,模型终于输出了一个关键的证明构造。
这个构造刚好解决了之前卡住所有数学家的噪音项问题。
在特定位置采样再加一个原点样本,就能把干扰项完全消掉。
金山木拿到这个核心结果,没有直接照搬就写论文。
补全了所有逻辑环节的细节,做完了形式化验证。
甚至连相关的提示词、验证代码,他都全部整理开源。
确保整个过程公开透明,接受整个学界的检视和复核。
2026年7月27日,这篇论文上传到了国际预印本平台。
论文作者只有金山木一个人,单位写的是北京协和医院神经外科。
论文刚出来的时候,没多少人当真。
毕竟作者身份太跨界,解决的又是悬了22年的难题。
怎么看都像是博眼球的内容,很难让人立刻相信。
最先认真对待这篇论文的,是美国康奈尔大学的汤森德副教授。
过去一整年里,他一直在尝试用大模型证明克鲁泽猜想。
他见过太多AI给出的看似完整、实则藏着漏洞的证明。
最开始他也是抱着挑错的心态,逐行核验这篇论文的逻辑。
可翻完整篇论文,他居然没找到一处实质性的错误。
汤森德又找来了华盛顿大学的格林鲍姆教授一起复核。
两位都是这个领域内的资深学者,反反复复检查了多遍。
最终他们都承认,这篇论文的证明逻辑是自洽且成立的。
他们还联系了猜想的提出者,已经退休的米歇尔·克鲁泽教授。
老人看完之后也给出了确认,自己的猜想终于成了定理。
