睡前刚看完智谱的财报,我觉得里面这几段洞察和预测写得还挺好的,但似乎没有看到有人分享:
Scaling 依然是通向更高智能的主路径,这一点没有变,变的是 Scaling 什么。
过去几年,Scaling 几乎等同于参数量。但参数越过“装下世界”的阈值之后,继续加宽的边际收益迅速下降,而其他维度的余量还远未用尽。
今天决定一个模型上限的,是四个因素的组合:基座规模、有效深度、训练深度、任务环境。
四者边际收益不同,且随阶段轮换。本公司的资源分配,就是在不同阶段判断哪个因素当前回报最高。
➡️ 基座规模:
上限由预训练决定。后训练是当期回报最高的旋钮,但智能的天花板由基座决定。一个模型能被训练到多深,取决于它在预训练阶段见过多少世界、留下了多少可被激活的结构。
把后训练做到极致之后,下一段增长必须回到基座。本公司从未停止基座迭代 —— GLM-5.3-Flash 已使用新一代架构与 30T 级多模态预训练语料,验证了新架构在中等参数量级上的效率。
在此基础上,本公司正在推进下一代基座模型的训练,方向包括更大的有效规模、更长的原生上下文与原生多模态的统一建模。
➡️ 有效深度
让模型多想几步。参数决定记多少,深度决定想多深。
循环架构(Loop Transformer)通过层的循环复用,在不显著增加参数量的前提下提高有效计算深度,把算力从“记”转向“想”(本公司已在初步实验中验证了这一想法)。
这条路径与我们对任务的判断一致:网络安全这类工作需要的是把二十步因果链推到底不散架,这种能力来自深度,不来自总参数。
➡️ 训练深度
当前余量最大的一个。GLM-5.3 是这一判断的直接证据 —— 与 GLM-5.2 同架构、同总参数、同激活参数,唯一变量是后训练规模,端到端完成率提升超过 50%。
这条曲线尚未见顶,本公司将继续扩大长程任务的强化学习规模、延长有效训练轨迹、提高轨迹利用效率。
➡️ 任务环境
新出现的变量。当算法与算力都不再是唯一瓶颈,环境的数量、类型与复杂度开始直接决定模型能学到什么。这是过去两年新出现的维度,也是本公司下一阶段投入最集中的方向。
四个旋钮中,环境的扩建速度正在成为新的瓶颈。而更深一层的变化是:训练系统的三个组成部分:数据、环境、基础设施,都出现了由 AI 接管的早期证据。
数据开始自产。高质量人类数据正在见顶,公域数据接近用尽,而下一代基座需要的是数以万亿计、质量只升不降的 token。
我们的解法是一条 model-vs-model 的自我对弈管线:一个模型生成解法与内容,另一个模型评审、测试、执行验证,通过对抗检验的数据才进入下一环节。
之后是四层过滤 —— 规则校验确认可编译、推导自洽、格式合规;执行验证在沙盒中实际运行,执行结果本身就是最高质量的训练信号;模型评审再加一道判断;最后人工抽检校准。
沉淀下来的是可验证、可执行、可复盘的数据,同时反哺预训练、中训练与后训练三个阶段。
因此,数据的质量上限不再取决于人类标注的速度,而取决于模型自身的验证能力。
模型越强,生成的问题越难、验证越严,数据质量越高;更好的数据再训练出更强的下一代。数据从一次性的消耗品,变成可跨代复用的资本品。
环境开始自造。一个有用的训练环境必须可执行、可验证、贴近真实专业工作,而且需要成千上万个,手工搭建供不上。
在 GLM-5.3 的技术博客中,我们分享了一些我们的做法:
研究智能体从真实工作中采集任务模式,把资深工程师数天工作量的任务转化为可运行的长程环境,内含多步依赖与隐藏状态;裁判智能体逐一试做,确认任务确实可解;验证器在无法访问参考答案的条件下被合成,再用求解器轨迹发现并封堵奖励捷径;通过 oracle、no-op、未解状态三项检查的验证器,最终产出可直接用于强化学习的二值奖励。
slime 架构把数学、代码、沙盒、验证器降格为即插即用的数据组件,环境成为流水线上的标准产品。
需要说明的是,这条管线目前仍有相当数量的人工环节。让环境的生成与验证更加自主,是我们的下一步。
基础设施开始自我优化。推理系统的优化:内核、调度、量化、算子等,本质上是代码工程任务,而这恰是模型最强的能力域。
GLM-5.3-Flash 的推理引擎就是这样完成的:由 GLM-5.3 驱动的基础设施智能体协助工程师开发优化内核、诊断性能瓶颈、改进服务栈,最终在国产芯片上把端到端服务性能提升三倍。
同一逻辑也在训练侧运转:slime 让训练与大规模推理 rollout 共用一套数据流,强化学习中积累的配置经验与调度策略可直接迁移到生产服务阶段。
三条线指向同一个终局:模型参与自身的改进,形成递归式的自我改进(Recursive Self-Improvement)。
这不是一个遥远的概念,2026 年上半年本公司已经出现了它的早期形态:GLM-5.3 参与了服务 GLM 自身的推理引擎优化,GLM 生成的环境正在训练下一代 GLM。
差别只在于,今天这个回路里还站着大量工程师。回路每收紧一环,智能进步的速度就更多地由环境生长的速度决定。
这就是我们的技术愿景:Fully Self Training,下一代 GLM,将在上一代 GLM 搭建的环境里训练。