ViTacWorld: Scaling Visuo-Tactile World Models for Contact Rich Robot Manipulation论文笔记
ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation
一句话概括
ViTacWorld 用大规模真实+仿真的视觉-触觉-动作数据训练一个 action-conditioned world model,然后用它生成额外的“梦境轨迹”来增强机器人策略训练,也可以在真实上机前粗略评估策略会不会成功。
引言以及摘要部分
富接触机器人操作(Contact-rich robot manipulation)需要物理交互线索,而这些线索通常对摄像头是不可见的,这使得触觉感知对于稳健的控制至关重要。 提出了 ViTacWorld,一种以动作 conditioned(action-conditioned,即以动作为条件的)视触觉世界模型,用于可扩展的富接触机器人操作。该模型首先使用大规模的真实与仿真视触觉轨迹进行预训练,然后使用真实世界的策略 Rollout(策略执行轨迹)进行微调,以更好地匹配下游的操作行为。
ViTacWorld,这是一个视触觉世界建模框架,能够以机器人动作块(action chunks)为条件,生成具有时间对齐的视觉和触觉观察的富接触操作 Rollout。将触觉感知建模为一个额外的生成视角(view),并通过“视角感知条件控制”(view-aware conditioning)和“跨视角注意力机制”(cross-view attention)将视觉与触觉流进行对齐,这确保了两种模态之间的跨视角一致性。
贡献如下:
- 提出了 ViTacWorld,一个以动作为条件的视触觉世界建模框架,能够为富接触机器人操作生成时间对齐的视触觉-动作 Rollout;据我们所知,这是首个用于机器人视触觉-动作轨迹生成的基于世界模型的框架;
- 开发了一个可扩展的训练流水线,结合了公开视触觉-动作数据、仿真生成的视触觉交互以及真实世界策略 Rollout 的微调,从而实现了视触觉世界模型的扩展;
- 证明了 ViTacWorld 不仅能通过合成 Rollout 增强来提升下游触觉策略,还能通过在受控动作序列下预测视触觉结果,支持以动作为条件的策略评估。
方法
图1:ViTacWorld 概述。 右侧展示了规模化训练流程,即利用真实的视触觉数据和与任务对齐的仿真数据进行预训练,再结合真实机器人任务数据与策略展开数据进行目标域微调。左侧展示了以动作为条件的视触觉世界模型及其展开生成过程。视觉流与触觉流被编码为潜在标记,并通过视角感知的 DiT 进行建模,以生成以策略为条件的展开,这些展开同时服务于数据集增强与策略评估。
问题定义 (Problem Formulation)
旨在学习一个用于富接触机器人操作的以动作为条件(action-conditioned)的视触觉世界模型。 在时间步 t 时,我们将多模态观察表示为 ot={Itv}v∈V,其中 V={main,wrist,tactile} 分别表示外部摄像头、腕部摄像头以及类图像触觉流。 给定一个长为 H 步的世界模型动作序列 ut:t+H−1(其中每个动作被表示为末端执行器的相对运动及夹爪控制指令),模型将预测未来的视觉与触觉观察:
$$\hat{o}{t+1:t+H} = f\theta(o_t, u_{t:t+H-1}, m)$$
其中 m∈{0,1}∣V∣ 是用于处理异构训练数据的“视角存在掩码”(view-presence mask)。
以动作为条件的视触觉世界模型 (Action-Conditioned Visuo-Tactile World Model)
对于每个训练样本,主摄像头、腕部摄像头和触觉观察分别由 VAE [48] 编码器编码为潜在 token(latent tokens),并组合成一个统一的视触觉序列。 调整了以动作为条件的 DiT (扩散模型) 架构,引入了流感知调制(stream-aware modulation)与显式跨流信息交换(explicit cross-stream exchange),这使得模型能够在生成对齐的视觉和触觉观察的同时,复用机器人运动先验。
为了让 DiT 感知到每个潜在 token 的来源流,我们为视觉流和触觉流引入了流身份嵌入(stream identity embeddings) ev。这些嵌入被投影到与时间步和动作条件相同的 AdaLN 调制路径中。对于每个 DiT 模块 b,首先在各个流内部应用流感知自注意力机制:
Z~bv=SelfAttnv(AdaLN(Zb−1v;cb+P(ev))),v∈V
其中 Zbv 表示视角 v 的潜在 token,cb 表示时间步-动作条件,P 是一个初始化为零的投影层。随后,一个显式的跨视角注意力模块(cross-view attention module)在不同流之间交换信息:
$$Z_b^v = \text{CrossViewAttn}^v \left( \tilde{Z}_b^v, {\tilde{Z}b^{v'}}{v' \neq v} \right), \quad v \in \mathcal{V}$$
避免了在普通自注意力过程中摄像头与触觉 token 之间出现无控混淆,同时仍然允许触觉流与视觉流交换接触信息。
ViTacWorld 遵循机器人视频先验世界模型的动作约定。动作序列通过继承的动作条件路径进行嵌入,为了支持多视角视触觉生成,我们只需在相应的潜在时间步上,将动作条件在视觉流和触觉流之间重复应用。
ViTacWorld 使用底层视频世界模型的潜在去噪目标(latent denoising objective)进行训练,该目标作用于未来的视觉和触觉潜在表示。z0 为目标潜在 Rollout,zσ 为扩散噪声水平为 σ 时的加噪版本。在给定的当前观察、机器人动作、流身份和视角存在掩码的条件下,模型预测去噪目标:
$$\mathcal{L}{\text{wm}} = \mathbb{E}{z_0, \sigma} \left[ \left\Vert{} D_\theta(z_\sigma, \sigma, o_t, u_{t:t+H-1}, m) - z_0 \right\Vert{}_2^2 \right]$$
损失仅应用于未来的预测帧和有效的视角流。
ViTacWorld 通过给视觉和触觉打上“身份标签”(流身份嵌入),并设计“先组内交流、再组间交流”的新型注意力机制(流感知调制(stream-aware modulation)与显式跨流信息交换(explicit cross-stream exchange)),成功将一个只会看视频的预测模型升级为一个“视觉触觉”预测模型。最终,它能够根据一个动作指令(沿用原有路径,并在视觉和触觉对应的时间上复用),同时生成未来几秒钟内视觉画面如何变化、以及传感器手感如何变化的逼真“剧情回放”(Rollout),且保证画面和手感在时间上是严格同步的。
AdaLN 是 自适应层归一化(Adaptive Layer Normalization) 的缩写。它是一种在扩散Transformer(DiT) 等模型中,用于注入条件控制信号(如时间步、动作指令、类别标签等)的核心技术。 简单来说,它就像一个智能的“调节旋钮”,能根据输入的条件信息,动态地调整网络内部的数据流,从而引导模型生成符合要求的内容。
ViTacWorld 预训练与微调 (ViTacWorld Pretraining and Finetuning)
ViTacWorld 的关键设计目标在于突破小型特定任务触觉数据集的限制,实现视触觉世界模型的扩展,首先在大规模公开与仿真视触觉数据上预训练模型,随后利用我们目标环境中的真实示范(demonstrations)与策略 Rollout 对其进行微调。
为了处理异构视角覆盖的情况,我们使用带有视角存在掩码的固定流布局,允许不完整的轨迹参与预训练,而不会损坏缺失的观察流。 采集了任务对齐的仿真数据作为补充预训练源,以连接大规模公开数据和我们目标的真实机器人任务 使用在真实机器人上采集的专家示范和策略 Rollout,将 ViTacWorld 迁移适配到目标真实世界环境中。
视触觉策略改进与评估 (Visuo-Tactile Policy Improvement and Evaluation)
通过“虚拟预演 → 筛选成功梦境 → 扩充训练集 → 优化真实策略”的循环,让机器人能够利用“脑补”的经验来学习,并在真正动手前先“过一遍电影”来确认方案可行性,极大地降低了对昂贵真实数据的依赖和物理实验的风险。
给定真实的初始观察以及下游触觉策略给出的动作块(action chunks),ViTacWorld 可以自回归地生成富接触的视觉-触觉 Rollout。这些“构想”出的 Rollout 可以通过人工或自动方式检查其成功与否,挑选出的成功 Rollout 将转化为“梦境数据”(dream data),用以增强真实示范数据,以供策略训练使用。 设 πϕ 表示将当前观察 ot 和任务指令 l 映射到 H 步动作块的下游触觉策略:
$$a_{t:t+H-1} \sim \pi_\phi(\cdot \mid o_t, l)$$ 给定当前观察和动作序列,ViTacWorld 预测未来 H 步的 Rollout:
$$\hat{o}{t+1:t+H} = f\theta(o_t, u_{t:t+H-1}, m)$$ 将生成的观察 o^t+k 作为下一个策略输入,并自回归地重复此过程。 根据任务成功率和视触觉合理性对生成的 Rollout 进行筛选,将选定的 Rollout 转换为策略训练轨迹,并将其与专家示范进行合并:
Daug=Dexpert∪Ddream
使用该增强数据集即可微调下游触觉策略。此外,这些包含策略在内的 Rollout 也可以作为“构想执行”进行检查,使 ViTacWorld 在部署到真实机器人之前提供轻量级的评估信号。
实验
主要是在验证一件事:ViTacWorld 生成的视觉-触觉 rollout 是否真的能帮助下游机器人策略变强
实验设置
做了四个真实机器人接触操作任务: Charger Plugging:充电器插入 Cucumber Peeling:黄瓜削皮 U-Block Insertion:U 形块插入 Cuboid Insertion:长方体插入 实验平台是 Franka Panda 机械臂,夹爪上装 Xense 视觉式触觉传感器,同时有第三人称相机和腕部相机。策略输入包括视觉、触觉、本体状态和任务指令。
实验流程
- 先收集真实专家演示,共 300 条。
- 用专家数据训练初始策略。
- 让初始策略在真实机器人上 rollout,每个任务 50 条,包含成功和失败。
- 用这些真实 rollout 微调 ViTacWorld。
- 再用 ViTacWorld 生成“想象出来的”视觉-触觉轨迹。
- 筛选出 200 条高质量成功 rollout。
- 把这些生成数据加入专家数据,重新训练下游策略。
- 最后在真实机器人上测试成功率。
实验效果
加入 ViTacWorld 生成数据后,下游策略成功率明显提升。最重要的是 Table 1: π0.5 + tactile 只用专家数据:平均成功率 42.5% 加入 ViTacWorld rollout 后:平均成功率 67.5%
表1:真实机器人成功率(%)。“仅专家”使用真实专家演示,而“专家 + ViTacWorld 模拟生成”则用生成的视觉触觉模拟数据扩充相同的专家数据。
还做了世界模型质量评估,对比不同模型变体。见 Table 2。结果说明:
- 没有预训练时,生成质量较差。
- 加入大规模真实视觉-触觉数据预训练后更好。
- 再加入任务对齐的仿真数据后最好。
表2:世界模型对保留的真实世界验证片段的预测结果的定量评估。给定第一个观察帧和真实动作序列,每个模型预测未来展开过程。我们报告预测未来观察结果与真实未来观察结果之间的逐视角PSNR、SSIM和LPIPS指标,其中PSNR/SSIM值越高、LPIPS值越低,代表生成质量越好。

总结与局限性
本文提出了ViTacWorld,这是一种面向接触密集型机器人操作的动作条件视觉触觉世界模型。可在机器人动作下生成时间对齐的视觉和触觉模拟轨迹,既能作为视觉触觉动作合成数据的可扩展来源,也可作为轻量级策略评估工具。针对接触密集型任务的实验表明,ViTacWorld能够生成策略优化的模拟轨迹,并支持基于想象的策略评估。
尽管ViTacWorld实现了视觉触觉模拟生成在多样数据源和丰富接触任务上的扩展,但当前成功生成数据的筛选仍部分依赖人工检查。未来工作将探索结合视觉-语言模型或多模态评估器的自动化过滤,以进一步提升生成数据整理流程的可扩展性。
与Robot-Factored World Models via Robot Rendering的异同
这两篇都在回答同一个“大”问题:如何让视频世界模型理解“机器人动作会怎样改变环境”? 但它们切入点不同。RoFacto 更关心动作如何被机器人身体实现,ViTacWorld 更关心接触过程中的视觉-触觉反馈如何随动作演化。
| 对比项 | Robot-Factored World Models via Robot Rendering | ViTacWorld |
|---|---|---|
| 核心问题 | 原始动作命令太抽象,世界模型很难学会动作如何变成机器人运动 | 接触操作中仅靠视觉不够,缺少触觉会漏掉关键接触状态 |
| 方法核心 | 把动作先转成 nominal trajectory,再通过 URDF 渲染成机器人几何/深度图 | 把视觉图像和图像式触觉观测都编码成 latent tokens,作为多流观测预测未来 |
| 动作条件怎么表达 | 动作不直接作为向量喂入,而是转成“可见的机器人轨迹/几何” | 动作 chunk 仍作为 action conditioning 输入 DiT,同时条件化视觉和触觉生成 |
| 模型需要学什么 | 主要学习环境如何响应已经渲染出来的机器人运动 | 学习在动作条件下,视觉和触觉如何共同演化 |
| 被显式外置的东西 | 机器人控制器、运动学、几何外观、部分 embodiment 信息 | 没有显式外置机器人几何,重点是加入触觉观测流 |
| 引入的额外信息 | rendered robot RGB/mesh、end-effector depth、scene depth、camera-aware static context | main camera、wrist camera、tactile image、stream identity、view-presence mask |
| 主要创新点 | robot rendering 作为世界模型的动作接口,缓解 action realization dilemma | 触觉作为第一类 observation stream,生成时间对齐的视觉-触觉 rollout |
| 下游用途 | 生成机器人交互视频、跨机器人 embodiment 泛化、从人类演示 retarget 到机器人视频 | 生成 dream visuo-tactile data 来增强策略训练,也可做轻量策略评估 |
| 适合解决的问题 | 动作表示、机器人几何、跨 embodiment、视角/深度一致性 | 接触丰富操作、触觉反馈、插入/剥离/精细接触调整 |
两者都不是传统的低维动力学模型,而是基于动作条件视频世界模型来预测未来观测。它们都认为,直接让模型从原始动作向量预测视频太难,所以要给模型更合适的中间表示或额外观测。 也就是说,它们都在改造“动作条件”: RoFacto 把动作条件变成渲染出来的机器人运动几何。 ViTacWorld 把动作条件和视觉-触觉多模态观测流结合起来,预测接触过程。
RoFacto 把 action realization 和 robot appearance 从世界模型中分解出去,让模型专注学习 scene response;ViTacWorld 则明确把触觉作为额外生成视角,并用 view-aware / cross-view attention 生成视觉-触觉
不同点的本质: RoFacto 的问题是: 给定一个动作,机器人身体到底会在哪里?模型不应该从零学习这个机器人运动学过程。 ViTacWorld 的问题是: 给定一个动作,接触时会看到什么、摸到什么?模型不能只靠视觉来理解接触状态。