马斯克旗下的 xAI 又走了一位真正的核心“炼丹师”。
张鼎怀在 X 上平静地宣布了离职。这位北大数学系毕业、跟着图灵奖得主 Yoshua Bengio 读完博士,履历横跨 Apple MLR、Meta FAIR 以及微软研究院(MSR)的顶级学者,在 xAI 战役的最前线默默战斗了一整年。
如果把大模型研发比作打仗,预训练(Pre-training)只是刚把阵地砸出来,接下来的后训练(Post-training)才是真正的肉搏战。张鼎怀在 xAI 负责的,恰恰是当下整个 AI 圈最难、也最贵的那块骨头:强化学习(RL)的稳定性与 Scaling。
现在只要是个大模型团队都能聊两句预训练,但决定一个模型到底能不能当 Agent、能不能写出高阶代码、有没有深度逻辑推理能力的,全靠后训练阶段的强化学习。
问题在于,当你在成千上万张 H100 组成的数据中心里跑 RL 时,这根本不是普通的算法研究,而是一场“高危物理实验”。训练跑着跑着,梯度突然爆炸、模型突然开始说胡话、或者 Scaling 曲线跑着跑着突然掉头向下……上千万美元的算力,可能在几秒钟内化为乌有。
张鼎怀干的事情,就是给这些算力巨兽装上“稳定器”。从 Grok 4.5 的大规模 RL 训练,到推动 Coding 和推理能力的强化学习算法改动,再到去年的 Self-Evolving Curriculum(让大模型在 RL 过程中自己调整学习课程),他就是那个真正握着 Grok 4.5 后训练遥控器的人。
在他离职的声明里,文字克制而真实。他特别提到了 xAI 那套极具马斯克色彩的“硬核作风”:快速推进,系统一炸立刻拉所有人进 War Room,不上厕所不睡觉,直到系统重新跑起来。
这种把顶级科研写成“战地攻坚”的高压节奏,确实炼出了 Grok 4.5 在代码和 Agent 上的惊艳表现,但也折射出硅谷 AI 军备竞赛的真实现状:从北大、Mila 到 Meta、微软,全球最顶尖的一批数学家和计算机天才,正在用极度的体力消耗和高压调试,去对冲强化学习的不确定性。
当预训练的红利逐渐见顶,后训练强化学习变成了各大巨头的生死线。能真正搞定万卡级别 RL 稳定 Scaling 的人,全球屈指可数。每一个真正跑过 Bigrun 的顶级研究员离职,对任何一家前沿 AI 机构来说,都是技术资产的重大流失。
张鼎怀暂时没有公布下一站,也许他只是需要好好睡个觉。
但这让人忍不住思考:当大模型的上限越来越依赖于顶级研究员在 War Room 里的熬夜调试,我们离真正的“自动化通用人工智能”,究竟是更近了,还是依然隔着无数张被炸毁的显卡?
