昊梵体育网

[LG]《Teaching LLMs to Self-Evolve: Culti

[LG]《Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning》S Wu, C Qian, X Chen, H Ji [University of Illinois Urbana-Champaign] (2026)

在代码生成与科学发现领域,利用环境反馈进行迭代演进是一个悬而未决的难题。过去的方法(如 AlphaEvolve)受困于将迭代视为纯粹的推理技巧,本质原因是模型缺乏显式的“元技能”训练,无法从失败历史中提取洞见或进行有目的的自我修正。

本文的核心洞见是:把自我演进能力重新看作一种可通过强化学习(RL)习得的认知习惯。由此,通过构建包含演进轨迹的合成数据,并配合基于执行效率的连续奖励信号,METAEVOLVE 这一关键操作使模型学会了在多轮对话中诊断瓶颈并主动重构代码。

这项工作真正留下的遗产是证明了代码训练能催生出跨领域的通用演进逻辑。它为后来者打开的新门是利用可验证领域(如代码)培养出的元技能去解决缺乏信号的开放式优化任务,但尚未跨过的门槛是如何在不依赖外部执行器的情况下实现完全内化的认知闭环。

arxiv.org/abs/2607.21971 机器学习 人工智能 论文 AI创造营