[LG]《LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks》T Ye, L Dong, G Chen, H Zhu… [Microsoft Research] (2026)
在 post-training 领域,对不可验证任务(如创意写作、建议提供)的对齐是一个难题。过去的方法受困于“信息瓶颈”,本质原因是 LLM-as-a-Judge 将丰富的文本反馈压缩成了单一的标量奖励,导致模型在优化时丢失了细粒度的偏好特征,极易陷入“奖励作弊”的陷阱。
本文的核心洞见是:把评价模型重新看作“教练”而非“裁判”。由此,通过“经验学习(EL)”这一关键操作,将教练生成的策略性经验知识作为上下文喂给教师模型,再通过在线上下文蒸馏,让策略模型直接吸收高带宽的分布监督信号,从而绕过标量奖励的表达极限。
这项工作真正留下的遗产是将反馈带宽提升了三个数量级,证明了文本经验比数值评分更具泛化力。它为后来者打开了通往“高保真知识内化”的大门,有效缓解了模型在高质量区间的性能停滞,但尚未跨过的门槛是教练模型本身的认知偏差仍会传递给学生。
arxiv.org/abs/2607.18110 机器学习 人工智能 论文 AI创造营








