这项由 Michael Mozer 领衔的谷歌 DeepMind 团队于本月发布的论文,标题朴素得近乎低调——《Recirculation》,却触及了当前大模型发展路径中一个越来越尖锐的悖论:过去三年,行业几乎默认"更强"等同于"更大",而这项工作恰恰证明,架构本身仍有大量未被开采的存量红利。
技术核心并不复杂:标准 Transformer 的信息流是单向的,深层神经元完成的语义消歧和状态更新,一旦生成完毕便被丢弃,浅层网络无从复用。这类似于一家公司决策链条冗长,前线员工却始终看不到高层最终拍板的信息,只能凭最初的模糊指令重新推演一遍。Recirculation 所做的,是打通一条反馈回路,让深层已经"想清楚"的东西重新回到输入端,供后续计算直接调用——且完全不需要重新训练模型权重。
真正值得玩味的,是团队随后加入的自适应版本:用一个轻量 MLP 学习每个 token 该在多大程度上信任这条回流信息。结果是,在 Gemma3 上,这套几乎不改动模型本体的机制,困惑度降幅达到 23%,反而略微超过了成本高得多的全量微调。这一结果的分量不在于百分点本身,而在于它挑战了一种默认假设:性能提升必须以重新训练、消耗算力为代价。当一个训练后置的推理时补丁能够跑赢全量微调,说明许多"性能损失"其实并非模型能力不足,而是架构设计中信息通路的结构性浪费。
当然,冷静的读者会追问代价何在。团队自己也承认,这项技术需要在预填充阶段进行串行处理,牺牲了并行效率,这在长上下文、高吞吐的生产环境中并非没有摩擦。它也并非思维链的替代品——论文特意将其定位为处理"基础状态追踪"而非复杂推理的工具,边界感清晰,这本身也是难得的诚实。
更深层的启示或许在于方法论本身:团队没有凭空设计新架构,而是让模型自身的内部动力学"告诉"研究者哪里需要修补。这种"用训练好的网络指导架构演化"的路径,如果被证明可推广,可能比单纯堆叠参数更接近下一轮效率革命的入口——尤其是在算力成本已成为全行业共同焦虑的当下。