尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

ACT 中的 CVAE(Conditional Variational Autoencoder,条件变分自编码器)分支

ACT 中的 CVAE(Conditional Variational Autoencoder,条件变分自编码器)分支 只把 ACT 中的CVAE(Conditional Variational Autoencoder,条件变分自编码器)分支展开到足够细,并把CVAE Decoder = ACT Policy保留为一个相对抽象的下游模型模块,这样可以清楚看到at:t+ka_{t:t+k}at:t+k​如何进入 CVAE Encoder、如何得到μ\muμ与log⁡σ2\log\sigma^2logσ2、如何重参数化成zzz,以及zzz如何同时参与重建 Loss 和 KL Loss。先说明两个忠实性细节。论文正文与 Appendix C 明确给出:CVAE Encoder 的输入为学习到的[CLS]、当前关节位置和长度为kkk的目标动作序列;组成长度为k+2k+2k+2的序列,经过 Transformer Encoder 后只取[CLS]输出预测zzz的高斯分布参数,再通过重参数化采样。图像不进入 CVAE Encoder,只进入 CVAE Decoder / ACT Policy。turn744173view2 官方代码进一步确认 latent dimension 为 32,并且实际输出的是μ\muμ和logvar,而不是直接输出标准差。1. ACT 中 CVAE 分支:完整训练 Mermaid阶段 S6:CVAE 联合损失与优化目标(CVAE Joint Objective)阶段 S5:损失输入(Loss Inputs)阶段 S4:CVAE Decoder / ACT Policy(Action Reconstruction)阶段 S3:潜变量采样(Latent Sampling)阶段 S2:CVAE 后验编码(CVAE Posterior Encoding)阶段 S1:CVAE Encoder 输入嵌入(CVAE Encoder Input Embedding)阶段 S0:原始训练数据(Raw Training Data)子损失(Sub Losses)PosEmbPadding Maskzβ = 10PredictionTargetMaskPriorGradientGradientGradientGradient via zGradient数据模块:四视角 RGB 图像(RGB Images I_t)Shape: [B, 4, 3, 480, 640]数据模块:当前关节位置(Joint Positions q_t)Shape: [B, 14]数据模块:专家目标动作块(Target Action Chunk a_t:t+k)Shape: [B, k, 14]数据模块:动作填充掩码(Action Padding Mask)Shape: [B, k]模型模块:🔥 CVAE 输入嵌入(CVAE Input Embeddings)结构:Learned [CLS] + Joint Linear 14→512 + Action Linear 14→512数据模块:学习式分类 Token(Learned [CLS] Token)Shape: [B, 1, 512]数据模块:关节位置嵌入(Embedded Joint Positions)Shape: [B, 1, 512]数据模块:动作序列嵌入(Embedded Action Sequence)Shape: [B, k, 512]操作模块:序列拼接(Sequence Concatenation)顺序:[CLS] → q_t → a_t:t+k数据模块:CVAE Encoder Token 序列(Encoder Token Sequence)Shape: [B, k+2, 512]
返回列表