I-JEPA论文笔记
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
摘要以及引言部分
本文展示了一种无需依赖手工数据增强即可学习高度语义化图像表示的方法
I-JEPA背后的理念很简单:从单个上下文块(context block)中,预测同一图像里各种目标块(target blocks)的表示。 引导I-JEPA产生语义表示的一个核心设计选择是掩码(masking)策略;具体而言,至关重要的是(a)对具有足够大尺度(语义上)的目标块进行采样,以及(b)使用信息足够丰富(空间分布广泛)的上下文块
图3:I-JEPA(基于图像的联合嵌入预测架构) I-JEPA 使用 一个上下文区域(context block)来预测同一张图像中多个目标区域(target blocks) 的表示(representation)。 上下文编码器(Context Encoder)采用 Vision Transformer(ViT),并且只处理可见的上下文图像块(visible context patches)。 预测器(Predictor)是一个较轻量(窄)的 Vision Transformer。它接收上下文编码器的输出,并结合位置标记(positional tokens,图中不同颜色所示),预测位于指定位置的目标区域表示。 目标表示(Target Representations)来自目标编码器(Target Encoder) 的输出。 目标编码器的参数不会直接通过梯度更新,而是在每一次训练迭代中,通过对上下文编码器参数进行 指数移动平均(Exponential Moving Average,EMA) 来更新。 最终,预测器输出的目标表示与目标编码器生成的真实目标表示之间,计算 L2 损失(L2 Loss),用于训练模型。.
学习目标:恢复缺失区域的语义表示(Embedding),而不是像素。
Context
│
Context Encoder
│
Predictor
│
↓↓↓↓↓↓
预测Target Encoder产生的表示背景 (Background)
图2:自监督学习中常见的三种架构。 这些架构都旨在学习输入之间的关系,其目标可以统一描述为: 对于彼此不兼容(incompatible)的输入赋予较高的能量(High Energy,即较大的评分值);对于彼此兼容(compatible)的输入赋予较低的能量(Low Energy,即较小的评分值)。
(a) Joint-Embedding Architecture(联合嵌入架构):联合嵌入架构(Joint-Embedding Architecture,简称 JEA)学习为兼容输入 x 和 y 产生相似的表示(embedding),而为不兼容输入产生不同的表示。 (b) Generative Architecture(生成式架构):生成式架构(Generative Architecture)学习根据一个兼容输入 x,直接重建目标信号 y。为了完成重建,会利用:编码器(Encoder)、解码器(Decoder)、一个额外条件变量 z(可能是隐变量) (c) Joint-Embedding Predictive Architecture(联合嵌入预测架构):联合嵌入预测架构(Joint-Embedding Predictive Architecture,简称 JEPA)学习根据兼容输入 x,预测目标输入 y 的表示(Embedding)。
| 方法 | 学什么 | 输出 | 代表方法 |
|---|---|---|---|
| Joint Embedding (JEA) | 对齐两个表示 | Embedding | SimCLR、BYOL、DINO |
| Generative | 重建原始数据 | Pixel / Token | MAE、GPT、Dreamer |
| JEPA | 预测目标表示 | Embedding | I-JEPA、未来的 JEPA 系列 |
方法 (Method)
总体目标如下:给定一个上下文块,预测同一图像中各个目标块的表示。I-JEPA方法是非生成式的,并且预测是在表示空间中进行的。
目标 (Targets)
给定一张输入图像 y,我们将其转换为 N 个不重叠的图块序列,并将其输入到目标编码器 fθ 中,以获得相应的图块级表示 sy={sy1,...,syN},其中 syk 是与第 k 个图块相关的表示。为了获得我们损失函数的目标,我们从目标表示 sy 中随机采样 M 个(可能重叠的)块。我们用 Bi 表示对应于第 i 个块的掩码,用 sy(i)={syj}j∈Bi 表示其图块级表示
目标块是通过掩盖目标编码器的输出而不是输入获得的,这一区别对于确保产生高语义级别的目标表示至关重要
上下文 (Context)
首先从图像中采样单个块 x,用 Bx 表示与上下文块 x 相关的掩码,被掩蔽的上下文块 x 被输入到上下文编码器 fθ 中,以获得相应的图块级表示 sx={sxj}j∈Bx
图4:I-JEPA 的上下文区域(Context)和目标区域(Target)掩码策略示例。 对于每一张输入图像,我们首先随机采样 4 个目标区域(Target Blocks),其参数设置如下:尺度(Scale):0.15~0.20(约占整张图像面积的 15%~20%)、宽高比(Aspect Ratio):0.75~1.5 随后,再随机采样 一个上下文区域(Context Block):尺度(Scale):0.85~1.0(覆盖图像的大部分区域) 最后,将上下文区域中与目标区域重叠的部分全部移除。 通过这种策略: 目标区域足够大,因此包含丰富的语义信息(Semantic)。 上下文区域包含大量可见信息,同时保持稀疏(Sparse),因此计算效率较高。
预测 (Prediction)
预测 M 个目标块表示 sy(1),...,sy(M)。为此,对于对应于目标掩码 Bi 的给定目标块 sy(i),预测器 gϕ(⋅,⋅) 将上下文编码器的输出 sx 和我们希望预测的每个图块的掩码标记(mask token) {mj}j∈Bi 作为输入,并输出图块级预测 s^y(i)={s^yj}j∈Bi=gϕ(sx,{mj}j∈Bi)。由于我们希望对 M 个目标块进行预测,我们应用预测器 M 次,每次都以对应于我们希望预测的目标块位置的掩码标记为条件,从而获得预测结果 s^y(1),...,s^y(M)
损失 (Loss)
损失仅仅是预测的图块级表示 s^y(i) 与目标图块级表示 sy(i) 之间的平均 L2 距离,即:$$\frac{1}{M}\sum_{i=1}{M}D(\hat{s}_{y}(i),s_{y}(i))=\frac{1}{M}\sum_{i=1}\sum_{j\in B_{i}}\vert{}\vert{}\hat{s}{y{j}}-s_{y_{j}}\vert{}\vert{}_{2}^{2}$$
表现
I-JEPA 性能评估总结 (第5-7章)
1. 高级语义表示与分类能力(第五章:图像分类)
- 核心结论:I-JEPA 在不依赖手工数据增强的情况下,依然能学习到极其强大的高级语义表示。
- ImageNet-1K 线性评估:不仅优于 MAE、CAE、data2vec 等同样不用数据增强的方法,而且计算成本更低。在使用更大分辨率(448×448)进行训练时,其性能甚至可以媲美依赖大量数据增强的视图不变性方法(如 iBOT)。
- 小样本学习(1% ImageNet 标签):在极少标签的情况下,I-JEPA 表现出更快的收敛速度和更高的精度,超越了 MAE,并在计算量远低于 data2vec 的情况下达到了同等性能。
- 迁移学习:在下游分类任务(如 CIFAR100、Place205)中,不仅大幅领先无增强方法,甚至在线性探测下超越了经典的 DINO 模型。
2. 局部与底层特征捕捉(第六章:局部预测任务)
- 核心结论:除了全局语义,I-JEPA 还能有效捕捉局部和底层的图像特征。
- 具体表现:在目标计数(Clevr/Count)和深度预测(Clevr/Dist)等密集的底层预测任务上,I-JEPA 取得了优异的成绩。在这类任务中,它大幅超越了 DINO 和 iBOT 等视图不变性方法(后者通常偏向于全局特征而忽略局部细节)。
3. 计算效率与可扩展性(第七章:可扩展性)
- 核心结论:I-JEPA 具有极高的计算效率,并且能够从更大的数据量和模型参数中获益。
- 模型效率极高:因为在表示空间而不是像素空间进行预测,I-JEPA 的收敛速度比 MAE 快约 5 倍。因为只需处理单一视图,它比 iBOT 等方法快得多(例如:训练一个巨大的 ViT-H/14 模型的计算量,甚至低于训练一个极小的 iBOT ViT-S/16 模型)。
- 数据规模扩展:在更大、更多样化的数据集(如 ImageNet-22K)上进行预训练,能够进一步提升 I-JEPA 在各项下游迁移任务上的表现。
- 模型规模扩展:将模型进一步扩大(如 ViT-G/16),能显著提高语义分类任务的性能(不过需要注意,过大的 patch size 可能会对局部预测任务产生轻微不利影响)。
预测器可视化 (Predictor Visualizations)
图6. I-JEPA预测器表示的可视化。 对于每张图像:第一列包含原始图像;第二列包含上下文图像,该图像由预训练的 I-JEPA ViT-H/14 编码器处理。后续列中的绿色边界框内,是由一个生成模型采样得到的结果,该生成模型对预训练的 I-JEPA 预测器的输出进行解码,而该预测器是以与绿色边界框位置相对应的位置掩码标记为条件进行预测的。 跨样本间共有的特征,代表了 I-JEPA 预测中所包含的信息。I-JEPA 预测器正确地捕捉了位置的不确定性,并生成了具有正确姿态的高级物体部件(例如,鸟的背部和汽车的顶部)。跨样本间变化的特征,则代表了表示中未包含的信息。在这种情况下,I-JEPA 预测器舍弃了精确的低级细节以及背景信息。
通过可视化手段,直观地看看模型的预测器到底学到了什么。
验证目标:研究人员想知道,预测器在只给出位置线索的情况下,能不能准确猜出那个位置应该是什么(即捕捉“位置不确定性”)。
方法与结论:他们把模型在抽象表示空间里输出的特征,通过一个解码器重新还原成我们能看懂的像素图像。结果发现,模型不仅猜对了,而且还能生成具有正确姿态的高级物体部件(比如准确画出了鸟的背部、汽车的车顶)。这直观地证明了,预测器成功理解了图像的空间结构和高级语义。
消融实验 (Ablations)
- 证明 1:必须在“表示空间”预测,不能在“像素空间”预测。
- 作者做了一组对比,发现如果让模型直接去预测底层的像素,性能会断崖式下跌。这证明了 I-JEPA 的核心优势:在表示空间中计算损失,能够帮模型自动过滤掉那些没用的像素级细节,从而强迫模型去学习更抽象、更高级的语义特征。
- 证明 2:“多块掩码”策略是最佳方案。
- 作者把 I-JEPA 首创的“多块掩码”(用一个上下文块去预测几个独立的目标块)和其他常规掩码方法(比如直接切成四块、只预测一块、或者随机打碎预测)进行了对比。结果表明,多块掩码策略在引导模型学习语义表示方面效果最好。
在表示空间中进行预测
表7. 目标块的消融实验。 在仅使用 ImageNet-1K 中 1% 标签的情况下进行线性评估。当损失函数应用于像素空间而非表示空间时,I-JEPA 表示的语义级别显著下降,这凸显了预训练过程中目标编码器的重要性。
I-JEPA 的一个关键组成部分是损失完全在表示空间中计算,从而赋予目标编码器产生抽象预测目标的能力
掩码策略
表6. 掩码策略的消融实验。 在ViT-B/16经过300轮I-JEPA预训练后,仅使用ImageNet-1K中1%的标签进行线性评估。比较了所提出的多块掩码策略。 光栅化掩码(Rasterized masking):将图像分成四个大的象限;使用其中一个象限作为上下文,预测另外三个象限。 单块掩码(Block masking):目标是一个单独的图像块,上下文是图像的其余部分。 随机掩码(Random masking):目标是随机的一组图像块,上下文是图像的其余部分。 所提出的多块掩码策略有助于引导I-JEPA学习语义表示。
| 策略 | 上下文(给模型看的) | 目标(要预测的) |
|---|---|---|
| 光栅化 | 整张图的 1/4(一个大象限) | 剩下 3/4 的象限 |
| 单块 | 整张图去掉一个小块 | 单独一个小块 |
| 随机 | 整张图去掉随机散的几个小块 | 随机散的几个小块 |
| 多块(I-JEPA 最终用的) | 一个大块(抠掉与目标重叠的区域) | 4个随机采样的块(分散在不同位置) |
结论
提出了 I-JEPA,这是一种无需依赖手工数据增强即可学习语义图像表示的简单且高效的方法 。我们表明,通过在表示空间中进行预测,I-JEPA 相比像素重建方法收敛得更快,并且能学习到高语义级别的表示 。与基于视图不变性的方法相比,I-JEPA 突显了一条在不依赖手工视图增强的情况下,利用联合嵌入架构学习通用表示的新途径。
I-JEPA 与世界模型的关系
在表示空间预测 + 多块掩码设计 → 强制模型过滤底层像素噪音,学习高级语义 → 通过可视化验证模型确实学到了图像的空间结构和高级特征 。从实验设置、跑的基准测试(ImageNet、CIFAR、目标计数等)以及对比的对象(MAE、DINO、iBOT)来看,它确实是一篇非常标准且硬核的 计算机视觉(CV) 论文 。
实际上,I-JEPA 正是通往“世界模型(World Model)”愿景的一块核心基石。
你可以注意一下这篇论文的作者名单,里面有深度学习巨头 Yann LeCun 。在 LeCun 提出的通往自主机器智能(Autonomous Machine Intelligence)的宏伟蓝图中,JEPA(联合嵌入预测架构)就是他钦定的“世界模型”的基础架构 。
为什么说 I-JEPA 本质上是在做一个世界模型?
- 世界模型的核心特征: 能够根据当前的“局部观测”以及某些“行动/条件”,在抽象的特征空间(而不是在微观的像素/物理层面)预测未来的状态或未知的环境。
I-JEPA 在做什么: 它根据图像的“局部观测(上下文块)”以及“位置条件(掩码标记)”,在抽象的表示空间中预测图像的其他“未知部分(目标块)” 。
传统的生成式方法(比如直接预测未来画面的像素)很容易因为预测微小的细节(比如树叶的纹理、水波纹)而崩溃,因为世界的底层细节是高度不可预测的。I-JEPA 证明了:只要放弃在像素层面死磕,退一步在高级抽象空间(表示空间)里做预测,模型就能极其精准地理解世界(图像)的结构 。
所以,准确地说:I-JEPA 是“世界模型”理念在计算机视觉(静态图像空间)领域的一次极具里程碑意义的落地实践。 它用标准的 CV 实验,证明了 LeCun 构想的“在表示空间做预测”的世界模型路线是完全行得通的。