Visuo-TactileWorldModels
Visuo-TactileWorldModels
一句话总结
VT-WM 在仅视觉世界模型之外加入指尖触觉,把接触状态锚定住,从而减轻遮挡下物体消失、瞬移、以及未受力却乱动等幻觉。实现上,Cosmos 与 Sparsh 分别编码外视和触觉,token 拼接后用分解时空自注意力交互,再用交叉注意力注入动作,RoPE 只做位置编码;训练用 teacher forcing 保稳定,用短程自回归采样保长程连贯。规划时 CEM 在想象里滚未来,按与目标图像的视觉潜变量距离选动作,触觉不进代价,只帮助动力学更可信,最后开环下到真机。
摘要与引言
图1. 视触觉世界模型以触觉补充视觉,为机器人-物体交互提供接触 grounding。请注意,当使用世界模型规划立方体堆叠任务时,VT-WM 在运输、放置和释放物体时具有蓝色立方体的物体永久性概念。基于视觉的触觉传感器所提供的接触 grounding 有助于减少 V-WM 中常见的幻觉,从而在接触丰富的操作任务中实现更可靠的零样本规划。
提出多任务视觉–触觉世界模型(Visuo-Tactile World Models, VT-WM),通过触觉推理来刻画接触物理。以触觉图像补充视觉后,VT-WM 能更好地理解接触丰富任务中的机器人–物体交互,从而避免仅视觉模型在遮挡或接触状态模糊时的常见失效:物体消失、瞬移,或以违反基本物理规律的方式运动。VT-WM 展现出显著的下游通用性:能将学到的接触动力学有效迁移到新任务,并仅凭有限演示实现可靠规划。
本工作推进面向机器人操作的世界模型:使其超越纯视觉想象,引入能够直接锚定接触交互的模态(见图 1).以触觉补充视觉后,操作世界模型获得局部接触信号,从而把预测锚定在接触物理上
提出首个多任务视觉–触觉世界模型(VT-WM)。视觉提供关于机器人运动学与任务场景的全局上下文,但无法揭示物理接触状态;触觉则补上这一缺失的局部信号,刻画手与物体的实际交互。将想象同时锚定于全局视觉与局部触觉后,VT-WM 能够保持物体恒存性,并预测符合运动定律的物体–机器人交互。
贡献有三:
- 提出首个多任务视觉–触觉世界模型,将触觉与视觉结合,同时建模全局上下文与局部接触动力学。
- 表明接触锚定显著提升想象质量:在一组操作任务上,物体恒存性提升 33%,对物理定律的符合程度提升 29%。
- 证明这些改进能带来更可靠的真实机器人零样本规划,在接触丰富任务中成功率最高提升 35%。
方法
模拟物体交互仍有困难:物体运动取决于外视相机看不见的力;抓取、推、放过程中的遮挡又常导致瞬移、消失或不合理动力学等伪影。 提出视觉–触觉世界模型(VT-WM),用触觉补充视觉以克服上述限制。触觉在遮挡期间提供接触信息,把模型的想象锚定在接触物理上,从而为接触丰富的操作任务生成更准确的推演。
视觉看不见的部分:用触觉感知接触
图2. 来自 Digit 360 传感器的触觉图像。白色方框标出了手握住螺丝时的接触区域。
触觉提供关键的局部感知,使机器人能够区分刚度、摩擦、粗糙度等仅靠视觉难以推断的属性,并刻画对操作至关重要的接触动力学。 视觉触觉传感器通常以 30–60 FPS 输出图像,给出接触区域的力、形状与纹理等信息。这对区分外视相机上看似相近的接触状态很关键:从远处看,机械手握杯子可能几乎一样,但触觉能区分无接触、轻触与稳固抓取。
本工作将 Digit 360 作为指尖传感器,安装在机械臂上的 Allegro Hand 上。图 2 给出 Digit 360 采集的触觉图像
多任务视觉–触觉世界模型
模型架构
图3. 视触觉世界模型。视觉隐变量((s_k))和触觉隐变量((t_k))分别由 Cosmos 和 Sparsh 编码器获得,随后与动作 (a_k) 一起被输入 transformer 预测器,以生成下一步状态 ((s_{k+1}, t_{k+1}))。
该模型要解决多模态机器人世界模型中的核心问题:如何把外视视觉与触觉结合,生成一致的想象未来。 架构包含三部分:视觉编码器、触觉编码器和自回归预测器。
视觉编码器从外视视频中提取潜变量 (s_k),刻画机器人及其环境。触觉编码器将高频接触反馈压缩为紧凑状态 (t_k),突出显著的物理交互。二者与控制动作融合后送入预测器;预测器是前向动力学模型,估计下一时刻状态:
(sk+1,tk+1)∼Pϕ(sk,tk∣ak)
由此可在给定控制动作下想象多种未来。与纯视觉世界模型不同,预测器利用触觉来消解视觉上无法区分的状态。
将预测器建模为有监督的下一状态估计问题,以未来潜变量的真值为目标
两路模态均使用预训练网络编码:视觉用 Cosmos tokenizer(Agarwal et al., 2025),Digit 360 触觉用 Sparsh(Higuera et al., 2024; 2025)。编码后的 (s_k) 与 (t_k) 加上正弦位置编码,并投影到统一表示 (R^{(b,t,s,d)})。视觉与触觉 token 沿空间维拼接,形成统一输入序列。预测器是 12 层 Transformer,交替使用两类注意力:
时空自注意力。 对视觉–触觉 token 使用分解注意力,分两步:
- 空间注意力使同一时刻内所有 token 交互;
- 时间注意力跟踪每个 token 随历史时刻的演化。
| 谁和谁说话 | 看见什么 | |
|---|---|---|
| 空间注意力 | 同一时刻的所有位置 | 这一瞬间的空间关系和视触觉对齐 |
| 时间注意力 | 同一位置的不同时刻 | 这个位置自己的运动/接触历史 |
这种分解能同时捕捉局部动力学与全局上下文,并避免全时空注意力 (O((THW)^2)) 的复杂度。动作 token 采用同样的分解注意力。
经交叉注意力的动作条件
每个自注意力块之后,视觉–触觉 token 对动作 token 做交叉注意力,把机器人控制输入写入预测。自注意力与交叉注意力交替,使模型依据感官观测与动作逐步 refinement 潜状态。
所有注意力层使用 旋转位置编码(RoPE)(Su et al., 2023)。Transformer 之后,表示经模态专用输出头投影回原维度,得到 (\hat{s}{k+1}) 与 (\hat{t})。
旋转位置编码(RoPE)
RoPE(Rotary Position Embedding,旋转位置编码) 是一种把位置信息写进注意力的方法,它不把位置向量加到 token 上,而是按位置旋转 query 和 key。
普通注意力看的是 (q^\top k)。RoPE 先把 (q,k) 的每对维度看成 2D 平面上的向量,再按位置转一个角度:
qm′=Rθ,mqm,kn′=Rθ,nkn
位置越靠后,转得越多。相乘后:
(qm′)⊤kn′=qm⊤Rθ,n−mkn
结果只取决于相对位置 (n-m)。也就是说,模型直接看到的是“这两个 token 隔了多远”,而不是各自的绝对下标。 例如:当前视觉 token 是 (q)(“现在手在哪”),历史视觉/触觉 token 是 (k,v)。没有位置时,它只知道“哪段特征像接触”。有了相对位置后,它还能知道:
- 这是刚刚发生的接触,还是好几帧之前的接触
- 这个触觉 token 和当前视觉 token 是同一时刻,还是上一时刻
训练视觉–触觉世界模型
训练时,视觉输入为 1.5 秒外视视频片段(9 帧、6 fps、分辨率 (320\times 192)),由 Cosmos 逐帧编码。触觉输入为每个 Digit 360 两帧(共 4 个传感器),覆盖最近 0.16 秒。这一更短时域反映接触信息频率更高、更局部,用以补充视觉较慢的全局上下文。
动作输入包括本体感觉状态变化(平移、四元数旋转),以及表示预设开/合构型的二值手部状态。将 30 Hz 的动作序列按 5 步一组分块,整块增量状态一并送入预测器。
训练目标结合 teacher forcing 与 自回归采样,以兼顾训练稳定性与长时一致性 Teacher Forcing 损失。 主要监督来自给定真值上下文的下一步预测。对长度为 (T) 的序列:
Lteacher=k=1∑T−1s^k+1−sk+11+t^k+1−tk+11
其中 (\hat{s}{k+1},\hat{t}) 由截至时刻 (k) 的真值状态预测得到,(s_{k+1},t_{k+1}) 是时刻 (k+1) 真值观测编码后的潜变量。该损失提供密集监督与稳定梯度,但在自回归推演时可能出现分布偏移。
采样损失。 为改善长程生成,还在采样轨迹上训练。训练时自回归采样未来状态 (H) 步(通常 (H=3\text{–}5)),再基于这些采样状态做预测:
Lsampling=k=1∑Hs^k+1−sk+1sampled1+t^k+1−tk+1sampled1
采样状态不回传梯度,以免训练不稳定。最终损失等权相加:
L=Lteacher+Lsampling
| Teacher forcing | 采样损失 | |
|---|---|---|
| 输入 | 真值 (s_k,t_k) | 模型自己滚出来的状态(不回传梯度) |
| 预测 | (\hat{s}_) | (\hat{s}^{\mathrm{sampled}}_) |
| 对齐目标 | 真值 (s_) | 还是真值 (s_) |
在想象中规划
由于预测器以动作为条件,可将视觉–触觉世界模型作为仿真器,嵌入 交叉熵方法(CEM)(Rubinstein, 1997)进行规划。 每一步,规划器在时域 (H) 上采样一组动作序列 ({ai_{k:k+H}}_{i=1})。对每条序列,预测器自回归生成未来潜变量 ((s_{k+1:k+H},, t_{k+1:k+H}))。 代价函数按相对目标图像的能量最小化给每条轨迹打分;实践中可取最终预测视觉潜变量 (s_{k+H}) 与目标图像潜变量 (s_{\mathrm{goal}}) 之间的 (\ell_2) 距离。
规划不以触觉作为目标信号,目标仍是纯视觉的。触觉的作用是提高所学世界模型的可靠性,从而间接改善规划。
实验
实验设置
平台
- 桌面 Franka Panda + Allegro Hand
- 每指尖一枚 Digit 360(共 4 路触觉)
- 一台外视相机给全局场景
数据(附录 B)
- 遥操作采集,成功/失败都保留
- 8 类接触任务:盘上 pick-and-place、按按钮、推、擦布、灯罩插入、桌腿插入、叠方块、马克笔涂写
- 训练:124 条、约 11.2 万点、平均约 40 s
- 验证:26 条、约 1.7 万点
- 对齐后下采样到 6 FPS
- 模态:腕部位姿/关节、外视视频、四指 Digit 360 视频
模型与对照
- V-WM:仅视觉多任务世界模型
- VT-WM:视觉 + 触觉(Cosmos 冻结核、Sparsh-X 微调)
- 共 173M 参数,可训练 96M;AdamW,80k step,32×A100,batch 64
规划器(附录 D)
- 想象空间里用 CEM 做目标图像规划
- 6 Hz,地平线 2 s,36 粒子,10 轮,动作 7 维(xyz + rpy + 开合)
- 代价:最终视觉潜变量 与目标图潜变量的 (\ell_2)
- 触觉不当目标,只作初始上下文(区分已接触/未接触)
- 最优序列在真机上 开环执行,CEM 最多调 3 次
实验设计
| 问题 | 问什么 | 怎么评 |
|---|---|---|
| 接触感知 | 触觉能否让想象更物理、更保物体 | 同一动作序列下对比 rollout vs 真值 |
| 零样本规划 | 更好的接触理解能否变成真机规划 | CEM 开环迁移 |
| 下游通用性 | 少数据新任务能否快速适配 | 20 条演示微调后再规划 |
接触感知(4.1) 动作来自真机演示,V-WM / VT-WM 条件相同。指标取 World Consistency Score 的三块:
- 物体恒存性:遮挡后物体是否还在、是否在正确位置重现 用 CoTracker 跟关键点,算与真值轨迹的归一化 Fréchet 距离(越低越好)
- 因果符合性:没受力的物体是否应静止 同样用静止物体关键点的 Fréchet;距离大 = 幻觉运动,违反牛顿第一定律
- 动作可控性:附录 C 定性看 (\pm x/y/z)、开合是否对得上 评测任务 5 个:place fruits、push fruits、cube stacking、wipe with cloth、scribble with marker
零样本规划(4.2) 难度递增 5 任务,每任务 5 次、不同初值:
- 单目标:reach button、push fruits
- 多子目标:reach & push、wipe cloth、stack cubes
下游(4.3) 新任务 place plate in dish rack,只用 20 条 演示继续训。10 次试验,随机“盘已在手中”的初位姿;子目标是对齐 + 插入。
实验效果
- 想象质量:触觉主要补“接触消歧”
物体恒存性
- 五任务 Fréchet 平均降 约 33%(单任务 18–47%)
- 显著:place fruits、push fruits、cube stacking
- wipe / scribble 同向但不显著
- 叠方块:蓝色方块在手里被挡住时,VT-WM 仍保持表征,放开后出现在黄块上方;V-WM 容易“物体消失”
因果符合性
- 无接触幻觉运动平均少 约 29%
- 显著:place fruits −43.6%,push fruits −16.4%,wipe −66.1%
- scribble 略变差(不显著)
- 典型例子:手在布上方擦但没碰上。真值布不动;V-WM 布被拖走变形;VT-WM 更接近静止
动作可控性(附录) 轴移、开合与想象一致;触觉预测与真实接触指一致性较好。 一句话:V-WM 卡在外视混叠(悬空/接触看起来像);VT-WM 用触觉把“有没有碰上”钉住。
- 真机规划:自由空间差不多,接触任务拉开
| 任务 | 相对 V-WM | 直观差异 |
|---|---|---|
| Reach button | 都是 100% | 主要是运动学,视觉够用 |
| Push fruits | +10% | V-WM 易把水果推倒;VT-WM 更稳滑 |
| Reach & push | +35% | V-WM 够不着就推;VT-WM 先接触再推 |
| Wipe cloth | +31% | V-WM 悬空擦,布几乎不动 |
| Stack cubes | +11% | V-WM 放置时方块在想象里消失 |
最大增益出现在需要持续接触的多步任务,和摘要里“最高 +35%”一致。
- 少样本新任务
- 20 条演示微调后,真机规划成功率 77%
- 失败多为“盘子放到架旁边”,是精度问题,不是任务结构没学到
- 作者认为可复用已有的对齐、接触调节先验
总结
视觉–触觉世界模型(VT-WM)用触觉补充视觉,使面向机器人操作的世界模型能够锚定在接触上。VT-WM 将指尖触觉与外视视觉结合,把想象锚定在接触物理中,从而得到更准确的推演,并刻画遮挡下的物体恒存性以及对物理定律的符合性。
从两个问题比较了 VT-WM 相对 V-WM 的多模态收益。
第一,加触觉能否提升世界模型对接触的理解? 在相同动作序列下对比自回归推演:VT-WM 能在物体被机械手遮挡时仍保持恒存性,也能让未受力物体保持静止。定量上,相对 V-WM,归一化 Fréchet 距离平均下降 33%,更接近真实物体动态。
第二,接触锚定能否提升规划? 用基于 CEM 的想象做目标条件规划,并在随机初值下零样本迁移到真机。自由空间任务(如到达)上两者接近;在需要精确手–物体交互的接触丰富任务(推、擦、叠)上,VT-WM 成功率最高高出 35%。
局限性
触觉形态很窄 只用了 Digit 360 这类视觉触觉。框架理论上可换别的触觉,但前提是要有对应的预训练编码器。没有验证力/力矩、阵列皮肤、不同品牌触觉传感器。
接触感知仍在训练分布内 评测轨迹是未见过的,但任务还是训练集里那些。 没证明:全新操作技能、新物体属性上,接触理解还能不能保持。
规划泛化很弱 真机规划只随机了机器人初态,场景和物体基本固定。 没测:尺寸、形状、颜色、质量/摩擦等视觉或物理属性变化。
CEM 规划又慢又开环 每个粒子都要自回归 rollout,算得起、控不快。结果只能按轨迹块开环执行,不像常规策略那样高频闭环。接触一旦在执行中偏离想象,没有在线纠正。