昊梵体育网

RL 后训练,真的只是在放大已有能力吗? 读到论文:《RL Post-Train

RL 后训练,真的只是在放大已有能力吗?
读到论文:《RL Post-Training Builds Compositional Reasoning Strategies》。
关于 RL 后训练,有个争论:它只是放大基础模型已有能力,还是能把基础技能组合成新的推理策略?
论文搭了可审计的“符号改写”环境:预训练仅见过基础单步改写;后训练时,只根据答案正误获得二元奖励。
RL 会先巩固基础操作,再发现更高阶的组合策略:一种是把连续步骤压缩成可复用的“宏操作”;另一种是把独立步骤并行完成。
这些策略不是偶尔蒙对的捷径。追踪发现,它们会被反复调用,最后沉淀成稳定的策略库。
作者还对比了 rejection fine-tuning。RFT 前期也能提升,但很快到平台期,还会产生许多无效捷径;RL 的优势不只是探索更多,而是更有选择地强化与成功相关、复用结构。
我最受启发的是:预训练给 RL 的不应只是零散知识点。只有基础技能已被组织成可执行的过程,RL 才能继续把它们压缩、组合成新策略。
当然,结论来自可控的符号环境,不能直接等同于所有真实 LLM 场景。但它提供了视角:RL 后训练的价值,可能不是刷更多正确答案,而是把弱的程序性能力,打磨成稳定、可迁移的组合策略。

RL后训练 强化学习推理 组合推理策略 组合泛化 二元奖励 稀疏奖励学习 RejectionFineTuning howto用好AI 提供思路和创新点