昊梵体育网

[LG]《On-Policy Delta Distillation》B Heo,

[LG]《On-Policy Delta Distillation》B Heo, J Hwang, S Yun, D Han [NAVER AI Lab] (2026)

在大语言模型后训练领域,在线策略蒸馏(On-Policy Distillation)试图通过模仿教师模型的输出来传递推理能力。然而,传统方法受困于教师模型自带的风格偏好和基础语言惯性,本质原因是它们将教师模型的最终分布视为单一目标,无法将推理逻辑从通用的“下一标记预测”中剥离出来。

本文的核心洞见是:将蒸馏奖励重新看作教师模型与其基座模型之间的“增量信号”。通过减去基座模型的对数概率,该操作过滤掉了通用的语言背景,精准提取出推理微调带来的认知跳跃。配合零中心化与联合约束操作,模型得以在训练中避开风格模仿,转而强化“因此”、“然而”等逻辑连接词的权重。

这项工作真正留下的遗产是证明了蒸馏“学习轨迹”优于蒸馏“最终状态”,使 4B 规模模型在数学与代码任务上能跨级超越 8B 模型。它为快速推理对齐开辟了领域无关的新路径,但尚未跨过的门槛是该方法高度依赖教师原始基座权重的获取,且因增加基座模型前向计算而带来了约 25% 的额外算力开销。

arxiv.org/abs/2607.15161 机器学习 人工智能 论文 AI创造营