昊梵体育网

ICLR26:空间结构是REPA表征对齐的关键 扩散生成 REPA ICLR

ICLR26:空间结构是REPA表征对齐的关键
扩散生成 REPA ICLR26
一、整体概述
1. 论文追问REPA为什么能加速扩散模型训练,真正关键的不是视觉编码器会不会给整张图分类,而是它是否保留物体、背景和局部区域之间的空间关系。
2. 作者据此提出iREPA,用不到4行改动进一步提速。

二、研究背景
1. REPA会让扩散模型的中间特征对齐预训练视觉编码器。过去大家通常用ImageNet线性探测准确率挑老师,默认语义越强,生成越好。
2. 但27个编码器的系统比较表明,这个指标与生成FID相关性仅为0.26;甚至分类更强的编码器,生成反而更差。

三、动机直觉
1. 生成图像不只要知道这是狗,更要知道狗头、身体和背景分别在哪。全局语义像给图片贴标签,空间结构则像保留草图。
2. 把全局信息过多混进每个图块,会让前景和背景特征变得相似,模型反而难学清布局。

四、技术路线
1、作者用图块间余弦相似度随空间距离变化,构造空间结构指标。它与FID的相关性超过0.85。
2、iREPA把原来的三层MLP投影换成3×3卷积,减少空间信息损失。
3、再对教师图块特征做空间归一化,削弱共享的全局成分,拉开不同位置的特征差异。

五、实验结果
1. iREPA在27种视觉编码器、不同SiT规模、REPA增强版、MeanFlow和像素空间JiT上都更快收敛。
2. 以SiT XL训练10万步为例,DINOv2的FID由19.06降至16.96,WebSSL由26.10降至16.66,PE大模型由32.35降至18.19。
3. 结论是:为生成模型选老师,先看空间组织能力,而不是只看分类榜单。