GLM-5.3 是怎么训出来的?智谱 SAO 异步 RL
最近把智谱那篇 SAO 的论文(arXiv:2607.07508)啃完了,它就是 GLM-5.2 和 5.3 背后那套 Agent 强化学习算法,记一下我的理解。
问题其实很工程:长程 Agent 的轨迹,短的两分钟结束,长的能跑二十分钟。同步训练要等最慢那条,前面跑完的只能干等,集群大量空转。GRPO 更麻烦,同一 prompt 要采一组轨迹算相对优势,组里有一条超长,其余全卡住。
那改成异步、谁先完成谁先训不就行了?新麻烦来了:一条轨迹开始生成时策略是版本 k,等它跑完,模型可能已更新到 k+7,这条数据就成了「离策略」的旧数据,直接训容易崩。
SAO 的解法是四件套配合。一是单轨迹采样,每个 prompt 只跑一条,完成就进队列,不等兄弟样本——但这样方差会变大,所以得把 Critic 请回来做状态基线。二是 DIS,用 rollout 时存下的逐 token 概率算一个比率,判断这个 token 对现在的模型有多旧;太旧的(比率出了可信区间)双侧直接扔掉,比 PPO 的裁剪更狠。三是让 Critic 跟得上:Actor 更新一次、Critic 追两次,还把 Critic 的注意力层冻住只训价值部分,梯度更稳。四是 Skip-Observation GAE,工具输出模型能看到,但不算它的动作,优势传播直接跨过去。
结果这边,同一个 Qwen3-30B 主干上,SAO 在 AIME2025 到了 97.3,比 GRPO+DIS 高了三四个点;能稳训约 1000 步,而普通 GRPO 一百多步就崩了。这套算法也确实用在了 744B 的 GLM-5.2 上。
我觉得最值得记的一点是:SAO 更像一套针对长程 Agent 场景验证过的训练配方,不是某个新损失函数。它用额外的 Critic 成本,换掉了 GRPO 的组内等待。不过有些细节论文没公开,比如价值预训练的数据规模、冻结注意力在 Dense 模型上是否也成立,这些按我自己理解写的,不一定全对。
大模型 强化学习 GLM 智谱 AI论文 RLHF Agent 机器学习 论文笔记









