昊梵体育网

[CL]《T²MLR: Transformer with Temporal Mi

[CL]《T²MLR: Transformer with Temporal Middle-Layer Recurrence》Z Cai, X Zhu, Y Dong, Y He… [Princeton University] (2026)

在自监督语言建模领域,维持跨步的长程逻辑推理是一个结构性难题。传统架构受困于“标记瓶颈”,即每一层产生的丰富高维表征在输出时被迫压缩为孤立的离散词元。这种机制导致抽象的中间推理状态无法在时间维度上持久存在,迫使模型在处理每个新词时都必须冗余地重新构建逻辑链条。

本文的核心洞见是:把推理过程看作在模型中层流转的连续信号,而非离散词元的简单叠加。由此,一种名为中层循环的关键操作使问题得以解开:它将前一个词元深层处的抽象表征,直接注入到当前词元的浅层输入中。这种深度到浅层的跨时空捷径,让模型在不增加计算深度的前提下,拥有了一个能够跨越生成步骤的持久化内部工作空间。

这项工作真正留下的遗产是证明了循环的“位置”比“存在”更重要,将推理能力的增强锚定在了模型的中层。它为后来者打开的新门是:无需从头预训练,通过对现有模型进行“插件式”改造即可大幅提升数学逻辑能力。但尚未跨过的门槛是:为了在训练时模拟这种时间连续性,必须支付数倍于常规模型的计算成本,这在一定程度上抵消了其推理时的低开销优势。

arxiv.org/abs/2607.15178 机器学习 人工智能 论文 AI创造营