[CL]《Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D》H Wen, Y Zhang, Y Chen, K Lyu [Tsinghua University] (2026)
在长文本建模领域,精确复制输入字符串是一个看似简单却悬而未决的难题。过去的方法(如 RoPE)即使在处理上下文窗口内的短文本时也常出现错误,本质原因是标准位置编码的一维归纳偏置迫使模型依赖局部上下文匹配的“捷径”,而非建立稳定的位置对齐,导致其在面对重复子串时极易产生干扰。
本文的核心洞见是:把文本序列重新看作二维网格而非一维线性流。由此,作者提出了 2D-RoPE 机制,利用换行符作为行分隔符为每个 Token 分配行列坐标,使复杂的长度相关检索简化为固定的列偏移操作。此外,Auto-2D-RoPE 进一步实现了无需显式分隔符的自适应坐标学习,从几何结构上强化了模型对位置对齐的感知能力。
这项工作真正留下的遗产是证明了维度升阶能显著增强 Transformer 的算法泛化能力。它为后来者打开的新门是通过重构位置表示来解决底层逻辑任务(如精确指令遵循和代码处理),但尚未跨过的门槛是如何在超大规模预训练中完全摆脱对特定格式(如换行符)的依赖,并保持在所有自然语言任务中的最优平衡。
arxiv.org/abs/2607.16072 机器学习 人工智能 论文 AI创造营








