
1. 核心结论V-JEPA 2 的整体训练流程可以分成两个主要阶段:Stage 1:V-JEPA 2 自监督预训练(Self-Supervised Pretraining)Stage 2:V-JEPA 2-AC 动作条件后训练(Action-Conditioned Post-Training)这两个阶段虽然都包含一个名为 Predictor 的模块,但它们的 Predictor不是同一个模型。更准确地说:P S t a g e 1 ≠ P S t a g e 2 \boxed{P_{\mathrm{Stage1}}\neq P_{\mathrm{Stage2}}}PStage1=PStage2二者不仅参数不共享,而且在模型规模、输入形式、注意力结构和学习目标上都存在明显差异。真正从 Stage 1 继承到 Stage 2 的,是 Stage 1 训练得到的视频编码器(Video Encoder)以及它定义的潜在表征空间(Latent Representation Space)。整个继承关系可以概括为:Stage1Encoder → Stage2FrozenEncoder \boxed{\text{Stage 1 Encoder}\rightarrow\text{Stage 2 Frozen Encoder}}Stage1Encoder→Stage2FrozenEncoder而不是:Stage1Predictor → Stage2Predictor \boxed{\text{Stage 1 Predictor}\rightarrow\text{Stage 2 Predictor}}Stage1Predictor→Stage2Predictor因此,理解 V-JEPA 2 的关键并不是把它看成“先训练一个 Predictor,再给这个 Predictor 加上 Action 继续微调”,而应该理解成:Stage 1 首先通过掩码预测学习一个高质量视觉表征空间;Stage 2 冻结这个表征空间,并在其上重新训练一个专门负责动作条件动力学预测的新 Predictor。2. V-JEPA 2 两阶段的总体结构可以先用一个简单的数学结构表示两阶段模型。Stage 1:E θ ( 1 ) + P ϕ ( 1 ) E_{\theta}^{(1)}+P_{\phi}^{(1)}Eθ(1)+Pϕ(1)其中:E θ ( 1 ) E_{\theta}^{(1)}Eθ(1)是视频编码器(Video Encoder)P ϕ ( 1 ) P_{\phi}^{(1)}Pϕ(1)是掩码预测器(Masked Predictor)Stage 1 完成之后,Stage 2 使用:E θ ( 1 ) ⏟ 继承并冻结 + P ψ ( 2 ) ⏟ 重新训练 \underbrace{E_{\theta}^{(1)}}_{\text{继承并冻结}}+\underbrace{P_{\psi}^{(2)}}_{\text{重新训练}}继承并冻结Eθ(1)+重新训练Pψ(2)因此:P ϕ ( 1 ) ≠ P ψ ( 2 ) P_{\phi}^{(1)}\neq P_{\psi}^{(2)}Pϕ(1)=Pψ(2)Stage 2 并不是简单地在 Stage 1 Predictor 上增加 Action 输入,而是重新训练一个新的动作条件预测器(Action-Conditioned Predictor)。从功能上看,两者分别承担:Stage1Predictor:MaskedFeaturePrediction \text{Stage 1 Predictor:Masked Feature Prediction}Stage1Predictor:MaskedFeaturePrediction以及:Stage2Predictor:Action-ConditionedFuturePrediction \text{Stage 2 Predictor:Action-Conditioned Future Prediction}Stage2Predictor:Action-ConditionedFuturePrediction这是整个 V-JEPA 2 → V-JEPA 2-AC 设计中最重要的区别之一。3. Stage 1:Predictor 是一个掩码特征预测器3.1 Stage 1 的真正目标Stage 1 的目标不是直接训练机器人世界模型,而是进行大规模视频自监督表征学习(Self-Supervised Representation Learning)。其核心问题是:如果视频的一部分内容被遮挡,仅根据剩余的视频上下文,模型能否预测被遮挡部分在 latent space 中应该具有怎样的表示?因此 Stage 1 本质上执行:VisibleContext → MaskedLatentRepresentation \text{Visible Context}\rightarrow\text{Masked Latent Representation}VisibleContext→MaskedLatentRepresentation而不是直接:CurrentState + Action → FutureState \text{Current State}+\text{Action}\rightarrow\text{Future State}CurrentState+Action→FutureState换句话说,Stage 1 Predictor 并没有显式的动作输入。3.2 Stage 1 的三个核心模块Stage 1 可以抽象为三个模型组件:1. 上下文编码器即上下文编码器(Context Encoder):E θ E_{\theta}Eθ负责处理经过 Mask 后的视频输入。2. Predictor即:P ϕ P_{\phi}Pϕ负责根据可见区域的 latent representation,预测被 Mask 区域的 latent representation。3. EMA Target Encoder即指数移动平均目标编码器(EMA Target Encoder):E θ ˉ E_{\bar{\theta}}Eθˉ它负责产生训练目标。其参数并不是直接通过梯度更新,而是通过 Context Encoder 的参数做指数移动平均(Exponential Moving Average, EMA)。3.3 Stage 1 的训练目标Stage 1 的目标可以写成:min θ , ϕ , Δ y ∥ P ϕ ( Δ y , E θ ( x ) ) − sg ( E θ ˉ ( y ) ) ∥ 1 \min_{\theta,\phi,\Delta_y}\left\|P_{\phi}\left(\Delta_y,E_{\theta}(x)\right)-\operatorname{sg}\left(E_{\bar{\theta}}(y)\right)\right\|_1θ,ϕ,Δymin∥Pϕ(Δy,Eθ(x))−sg(Eθˉ(y))∥1其中:x xx表示经过 Mask 后可见的视频上下文y yy表示预测目标区域E θ E_{\theta}Eθ是 Context EncoderE θ ˉ E_{\bar{\theta}}Eθˉ是 Target EncoderP ϕ P_{\phi}Pϕ是 Predictorsg \operatorname{sg}sg表示停止梯度(Stop Gradient)因此,Stage 1 Predictor 学习的是类似:P ( z m a s k e d ∣ z v i s i b l e ) P(z_{\mathrm{masked}}\mid z_{\mathrm{visible}})P(zmasked∣zvisible)的条件关系。它回答的问题类似于:在当前视频语义和运动上下文下,被遮挡区域的视觉 latent 应该是什么?所以 Stage 1 Predictor 更接近一个服务于 representation learning 的预训练预测头(Pretraining Prediction Head)。4. Stage 1 Predictor 的规模其实很小V-JEPA 2 的 Encoder 可以非常大,例如 ViT-L、ViT-H、ViT-g。但 Stage 1 的 Predictor 并没有随着 Encoder 同等扩大。论文中 Stage 1 使用的 Predictor 大致采用ViT-S Predictor规模:参数量约:22MHidden Dimension:384Depth:12Attention Heads:12MLP Dimension:1536因此可以近似表示为:P S t a g e 1 ≈ ViT-S , 22 Mparameters P_{\mathrm{Stage1}}\approx\text{ViT-S},\quad22\text{M parameters}PStage1≈ViT-S,22Mparameters这实际上揭示了一个非常重要的设计思想:V-JEPA 2 Stage 1 真正需要训练好的核心资产是 Encoder,而不是 Predictor。Predictor 主要负责产生足够有效的自监督训练信号,使 Encoder 被迫学习视频中的高层结构。因此,即使 Encoder 很大,Predictor 本身也不必拥有相同规模。5. Stage 1 真正留下来的是什么?Stage 1 最重要的训练结果不是:P ϕ P_{\phi}Pϕ而是:E θ E_{\theta}Eθ也就是一个可以将视频映射到高质量 latent representation 的视觉编码器:x t → E θ z t x_t\xrightarrow{E_{\theta}}z_txtEθzt