[LG]《Understanding Reasoning from Pretraining to Post-Training》J Shen, A Li, S Rahman, Y Sun… [New York University] (2026)
在复杂推理领域,强化学习已成为提升模型性能的核心,但其与预训练阶段的定量关系仍是黑盒。过去的方法将两者孤立研究,本质原因是通用语言模型的预训练数据海量且不可控,导致难以区分能力究竟源于底座积累还是强化训练,且全流程实验成本极高。
本文的核心洞见是:把国际象棋看作一个可控的推理实验场,通过模拟 LLM 的全流程(预训练-SFT-RL)建立起跨阶段的比例定律。由此,发现预训练损失能精准预测 RL 后的性能水平,且 RL 的提升速率与预训练词元量的对数呈线性正相关,这让“预训练到底要多强才能让 RL 见效”变得可量化。
这项工作真正留下的遗产是确立了预训练与 RL 的计算分配边界:随着总算力增加,资源应向 RL 倾斜以获取更高回报。它为后来者打开的新门是证明了 RL 并非简单的分布收缩,而是能从长尾中挖掘新解,但尚未跨过的门槛是如何在不损失模型通用采样多样性的前提下,抑制 RL 对错误模式的盲目放大。
arxiv.org/abs/2607.16097 机器学习 人工智能 论文 AI创造营








