Visual Calibration Enables World Models as Zero-Shot Simulators
Visual Calibration Enables World Models as Zero-Shot Simulators
一句话总结
SyncWorld 不直接输出动作,而是给动作条件世界模型加一段配置相关的视觉标定上下文 (Cs)(运动自由度、正负),让模型在新相机/新摆放/新单臂上读懂“当前数值动作在像素里意味着什么”,从而正确预测未来观测。训练时还用坐标增强逼它读 (Cs),再用教师(有标定)对学生(无标定)蒸馏,使测试时即使没有显式标定,也能从交互历史近似出动作–视觉映射。
摘要以及引言部分
图1:SyncWorld 可通过上下文视觉校准,在未见的相机角度和形态下实现零样本模拟。以一段展示全部六个运动自由度的简短交互片段为条件(左图),该模型可解决特定场景的动作-视觉映射,并能在全新环境中准确预测后续动作展开(右图),无需额外训练。
现有问题:动作并不是像素空间中的“通用语言”。视觉环境、相机视角、机器人摆放位置或本体形态一旦改变,同一组数值动作所对应的视觉表现也会随之变化。这会在混合训练中造成相互冲突的监督信号,并在部署时导致泛化脆弱。
提出 SyncWorld,这是一种以动作为条件的世界模型,能够在无需额外训练的情况下,作为零样本仿真器跨越未见环境使用,利用一段视觉标定片段(visual calibration episode)——即展示全部可控自由度的成对帧与动作——在上下文中指定当前配置特有的动作–视觉映射(Action–Visual Mapping)。使用视觉标定上下文进行训练,能够让模型依据视觉证据理解动作含义,并在没有显式标定时借助交互历史进行推断。
动作条件世界模型必须学习一种动作–视觉映射:即控制信号如何表现为视觉运动与状态转移。真实机器人系统中,这种映射高度依赖于具体配置。 这种配置依赖性带来了两个根本挑战:
- 冲突监督:混合多种配置会迫使同一个模型为相同动作值拟合多种互不兼容的动作–视觉映射,从而削弱泛化能力。
- 测试时映射不可自适应:在新配置中,动作–视觉映射会发生偏移,模型通常必须额外训练,否则就会失效。
提出 SyncWorld,这是一种动作条件世界模型,可在未见相机视角和单臂本体上充当零样本仿真器,将一段视觉标定片段作为上下文,用以说明当前本体如何把底层动作映射为视觉运动,从而使模型在推理时无需任何额外训练即可泛化到新环境。具体而言,提供一段简短的标定交互——即在当前配置下采集的成对视频帧与动作——作为上下文输入。这段标定交互有意覆盖全部六个运动自由度,并展示它们的视觉后果,从而显式给出该配置的动作–视觉映射。
SyncWorld 既可以条件于显式标定片段,也可以利用推演过程中自然积累的历史信息。在世界模型仿真器内对候选动作块进行测试时扩展(test-time scaling),我们可以利用模型想象出的推演来选择更好的动作,从而在新环境中无需任何训练地改进策略
主要贡献有三点:
- 面向可扩展、可控世界建模的 SyncWorld 与视觉标定。 我们提出 SyncWorld,这是一种经过视觉标定、具有细粒度动作条件的世界模型。它能够扩展到异构机器人数据,并通过条件于一小段视觉标定片段,零样本泛化到未见相机视角和单臂本体。
- 通过标定蒸馏实现基于历史的上下文自适应。 通过在训练中注入视觉标定,我们让模型学会从现成的交互历史中近似配置特有的动作–视觉映射,即使没有显式标定片段,也能提升灵活的上下文泛化能力。
- 通过测试时扩展实现零样本策略改进。 我们证明,SyncWorld 的零样本仿真能够带来实际的决策时收益:利用想象推演搜索候选动作,可在新环境中无需训练地改进策略,从而凸显世界模型作为零样本仿真器的潜力。
方法
图2:SyncWorld 架构。SyncWorld 是一种动作条件式世界模型,采用扩散Transformer(DiT)作为骨干网络来预测未来视频帧。该架构融合了视觉校准片段与交互历史,以明确特定场景下的动作-视觉映射关系。这些输入会被编码为姿态嵌入和视频潜在特征,从而使DiT能够生成时间和空间上均一致的未来帧。
希望构建一种动作条件世界模型,使其在多样化的视觉环境、相机视角和本体形态下仍保持可控.提出 SyncWorld,这是一种基于标定的世界建模框架:它将视频预测条件于视觉标定,从而使模型能够借助配置特有的视觉证据来理解底层动作。
基于标定的世界建模
世界模型的目标,是根据交互历史和未来底层动作预测未来视觉观测。在时刻 (t),我们将交互历史记为
Ht={(It−L+1,at−L+2),…,(It−1,at),It},(1)
其中 (I_t) 为 RGB 观测,(L) 为历史长度。给定未来 (H) 步动作块 (A_t=(a_{t+1},\ldots,a_{t+H})),标准的动作条件世界模型预测
It+1:t+H∼Wθ(⋅∣Ht,At).(2)
然而,同一组数值动作在不同配置下(相机外参、机器人基座位置或本体形态)可能诱发不同的视觉运动。为消除这种歧义,我们引入配置特有的标定上下文 (C_s),并将模型改为
It+1:t+H∼Wθ(⋅∣Cs,Ht,At),(3)
其中 (C_s) 为配置 (s) 的动作–视觉映射提供直接视觉证据,而无需显式估计外参,也无需测试时微调。
标定片段生成
图3:校准示例。为解决特定设置下的动作-视觉映射问题,我们收集了一段简短的交互序列,在此序列中机器人沿每个自由度执行定向运动。由于视觉效果不明显,我们未将夹持器开合纳入其中。每个片段仅对应一个控制维度,直观展示了在当前相机视角下,数值型动作如何转化为像素空间的运动。
对每个配置 (s),我们采集一段专用的标定交互片段
Es={(I1,a2),…,(IT−1,aT),IT},
由一台固定相机记录。其中 (I_t) 为 RGB 图像,(a_t\in\mathbb{R}^m) 是在 (I_{t-1}) 与 (I_t) 之间执行的底层控制。如图 3 所示,对每个自由度 (d\in\mathcal{D}),我们执行一次方向性运动(随机选择 (+d) 或 (-d)),随后回到标称姿态
提取标定子段
总结:整段标定视频太长,所以按 6 个自由度的正负方向各剪出一段最明显的短运动,得到 12 个短片段给模型看。
原始片段 (E_s) 便于采集,但对条件化而言过长。因此,对每个自由度 (d\in\mathcal{D}) 和符号 (\sigma\in{+,-}),我们确定性提取一个短子段 (C^{s,d,\sigma}),其中包含该方向上最强的连续有符号运动(细节见附录)。最终得到的 12 个子段,为配置 (s) 的动作–视觉映射提供了紧凑的视觉证据。
利用视觉标定学习世界模型
本文关注单视角 RGB 视频下的 7 自由度机械臂控制。动作空间包括沿 ({x,y,z}) 的平移、绕 ({\text{yaw},\text{pitch},\text{roll}}) 的旋转,以及夹爪控制。由于夹爪开合的视觉含义相对直接,我们仅用六个运动维度构建标定,并按固定的规范顺序组织子段:
Cs=[Cs+x,Cs−x,Cs+y,Cs−y,…,Cs+roll,Cs−roll].(4)
这些有序子段被拼接为世界模型的前缀上下文
尽管显式标定能提供直接的动作到视觉证据,模型仍可能走捷径:记住一种固定坐标系约定,而不是从 (C_s) 中读取语义。因此,我们引入两种训练设计:动作坐标增强,迫使模型依据标定来解释动作;以及标定蒸馏,使模型在没有标定时仍能仅凭历史进行推理。
动作坐标增强
总结:故意把动作坐标系打乱,逼模型从标定视频里读出当前这套动作语义,而不是死记一套全局通用的动作含义。
为防止模型把动作数值当作全局有效的语义,我们在训练时对标定 (C_s)、历史 (H_t) 和未来动作块 (A_t) 施加相同的坐标扰动。 随机翻转 ({x,y,z}) 的符号、置换这些坐标轴,并对平移维度施加全局尺度因子,同时保持视频观测不变。这些变换会改变表面上的动作–视觉映射,从而迫使模型从 (C_s) 推断正确的动作语义,而不是依赖固定约定。
面向实际推理的标定蒸馏
总结:训练时对同一模型同时喂“有标定”和“无标定”两种输入,让无标定预测对齐有标定预测。这样测试时如果有标定,可控性更强;如果没有标定,模型也能从历史交互里把当前配置的动作–视觉映射补出来。
考虑到部署时可能无法获得视觉标定,我们进一步训练模型在没有标定的情况下仍保持有效。 对每条训练轨迹,我们构造包含标定的教师输入,以及去掉标定的学生输入,并联合优化学生去匹配教师的预测。这鼓励模型仅从历史交互 (H_t) 中近似相关的动作–视觉映射。
通过世界模型排序实现零样本策略改进
图4:通过SyncWorld实现的零样本策略优化。给定自然语言指令和当前观测结果,VLA策略会生成多个不同的候选动作片段。SyncWorld从多个视角为每个候选片段预测未来的视觉结果,以确保空间一致性。VLM作为结果评估器,根据原始指令为想象的执行过程分配分数。选择奖励最高的动作片段执行,从而在新环境中实现无需额外训练的测试阶段策略优化。
将 SyncWorld 作为测试时的想象模块,用于在未见环境中改进给定策略,并遵循 GPC-RANK 测试时扩展框架。 在每个决策步,我们不再只生成一个动作块并直接执行,而是基于预测的视觉结果,对多个动作候选进行采样并排序具体地,给定当前观测 (O_t) 和指令 (l),我们从策略中采样 (K) 个候选动作块:
At(k)∼π(⋅∣Ot,l),k=1,…,K,(5)
其中 (A_t{(k)}=(a_{t+1},\ldots,a_{t+H}^{(k)}))。对每个候选,我们用世界模型推演其预测未来视频:
I^t+1:t+H(k)∼Wθ(⋅∣Cs,Ht,At(k)).(6)
随后用视觉语言模型(VLM)作为视觉结果评估器,得到分数 (s{(k)}=\mathrm{VLMScore}(\hat{I}_{t+1:t+H},l)),并选择最优候选 (k^\star=\arg\max_k s^{(k)})。我们执行 (A_t{(k\star)}),并重复该过程。
训练数据
训练 SyncWorld 需要覆盖多样视觉场景、相机视角和动作约定的交互数据。因此,我们主要在仿真中生成训练轨迹,以便大规模随机化相机与控制器配置.具体使用 RLBench、RoboCasa 和 RoboMimic
在 RLBench、RoboCasa、RoboMimic 里回放专家轨迹。回放时会随机改相机位置/视角,得到“单视角 RGB 视频 + 底层动作”。 目的是:同一套动作,换个相机看起来就不一样。这正好对应论文前面说的 动作不是像素空间里的通用语言。
每个随机出来的相机/环境配置,都会再采一段第 3.1 节那种标定交互,抽出 (C_s)。
受控扰动轨迹:专家演示几乎都是成功的。如果只看这些,模型可能偷懒,不管动作对不对都预测“最后成功了”。所以他们故意把专家轨迹搅乱一点,加入失败/偏离的推演,逼模型更忠实地跟动作走。
真实 DROID 数据:用来补视觉真实感和动作多样性。但 DROID 没有标定片段,所以它只是辅助;真正教模型“配置变了、动作视觉含义也变了”的,还是带 (C_s) 的仿真数据。
实验
实验目的
验证 SyncWorld 能否当真正的零样本仿真器,而不是只在训练分布里把视频做漂亮。论文用三件事来回答:
- 未见环境里,动作能不能被正确“落地”成视觉结果。
- 这种预测是否有 3D 一致性,而不是只拟合当前视角的像素。
- 想象推演能不能在测试时直接拿来改进策略,且不再训练。
实验设置
训练数据:主要来自仿真 RLBench、RoboCasa、RoboMimic。相机和控制器配置大规模随机化;每个配置都采一段视觉标定 (C_s)。额外加入扰动后的非成功轨迹,避免模型总预测成功;再用真实 DROID 补视觉和运动多样性,但 DROID 没有标定片段。 训练实现:单视角 (512\times512) 视频;条件于未来 16 步动作(约 1 秒);(4\times8) 张 H100,总 batch 64;约 2–3 天收敛。 评测原则:评测环境在训练时未见。- 仿真:ManiSkill、LIBERO,本体是训练里见过的 Franka Panda。
- 真机:自采轨迹,本体换成未见的 xArm,视角也是新的。这是更强的本体泛化测试。
数据规模:ManiSkill / LIBERO 各 50 条专家轨迹,真机 25 条;每条双视角,分别得到 100 / 100 / 50 段评测视频。策略改进实验走标准 LIBERO。 两种推理模式:- w/ Calib:额外给一小段视觉标定。
- w/o Calib:不给标定,只靠交互历史推断动作–视觉映射。
实验设计
可以记成三条主线,分别对应方法 3.1–3.3。
- 视频预测质量(4.2) 给短历史 + 未来 16 步动作,预测下一段视频。 对比 IRASim、WorldGym、Ctrl-World;指标是 PSNR / SSIM / LPIPS / FID。 这一项看的是:数值动作有没有被正确解释成像素运动。
- 跨视角 3D 一致性(4.3) 用一个视角生成推演,去和另一视角的真值视频比,指标是 Met3R(越低越好),并以双真值视角分数当经验上界。 这一项看的是:模型有没有学到 3D 结构,而不是死记当前相机的 2D 纹理。
- 零样本策略改进(4.4) 按 GPC-Rank:策略一次采样多个动作块,SyncWorld 想象未来,VLM 打分后执行最好的那个。 基策略是 LeRobot 上未做任务微调的 (\pi_0);每步采 8 个 16 步动作块;SyncWorld 生成 16 帧,并同时给前视和侧视;GPT-5 当零样本奖励模型。 每任务 50 个 episode。主文只报 Oracle 有提升空间 的任务,因为如果连真值仿真都帮不上,就分不清是世界模型差,还是 VLM 排序差。
- 消融(4.5) 分别去掉训练期视觉标定、去掉标定蒸馏,验证方法里两个核心设计各自干什么。
实验效果
视频质量上,SyncWorld 在 LIBERO / ManiSkill / 真机上都大幅超过基线;即使不加测试时标定,也已经明显更好,加上标定还会再涨一截。
| 设定 | 最强基线 Ctrl-World | SyncWorld 无标定 | SyncWorld 有标定 |
|---|---|---|---|
| LIBERO PSNR / LPIPS / FID | 24.8 / 0.137 / 16.5 | 27.9 / 0.049 / 8.7 | 28.3 / 0.035 / 7.0 |
| ManiSkill PSNR / LPIPS / FID | 22.6 / 0.178 / 26.5 | 26.0 / 0.071 / 14.0 | 27.0 / 0.049 / 9.7 |
| 真机 PSNR / LPIPS / FID | 25.2 / 0.142 / 22.8 | 28.8 / 0.042 / 5.9 | 29.2 / 0.039 / 5.5 |
跨视角一致性同样是 SyncWorld 最好,并接近双真值上界:Met3R 平均分 Oracle 0.523,SyncWorld 有标定 0.538、无标定 0.542,基线大约 0.56–0.58。说明它不是只在当前视角“画得像”,而是动作效果在 3D 上更站得住。 策略改进上,在 Oracle 有空间的 3 个 LIBERO 任务里,直接执行基策略、无标定、有标定、真值仿真的成功率是:
| 任务 | Baseline | 无标定 | 有标定 | Oracle |
|---|---|---|---|---|
| BBQ Sauce | 0.52 | 0.54 | 0.58 | 0.60 |
| Orange Juice | 0.56 | 0.68 | 0.72 | 0.80 |
| Black Bowl | 0.48 | 0.58 | 0.60 | 0.66 |
有标定后更接近 Oracle。附录也说明:有些任务连真值视频都提升不了,瓶颈在 VLM 排序,不在世界模型。
去掉训练期标定:跨域视频质量和 Met3R 都明显掉,说明标定是在教“可迁移的动作–视觉映射”。 去掉标定蒸馏:在测试时没有显式标定时掉得更狠,说明蒸馏是在把标定能力蒸到历史上下文里。 即使测试时不给标定,完整模型也接近有标定版本。作者把这归功于:标定训练 + 动作坐标增强 + 蒸馏,让历史交互本身变成隐式标定。
总结
提出了 SyncWorld,这是一种带有视觉标定的动作条件世界模型,能够扩展到异构机器人数据,并零样本泛化到未见的相机视角与本体形态 通过引入一小段上下文内标定交互,SyncWorld 能够从现有交互历史中推断配置特有的动作–视觉映射,并在域偏移下生成可控、时间连贯的推演
局限性
SyncWorld 真正解决的是:同一组数值动作,在新相机/新摆放/新单臂上,像素运动该怎么解释。 它没有解决的是:复杂物体动态、长程物理、极端观测、精细新本体控制,以及“用想象视频选动作”时评估器本身不可靠的问题。 所以更准确的定位不是“通用零样本物理仿真器”,而是: 一个可上下文校准的、动作条件视频仿真器。 适合做短时想象、动作排序和跨配置迁移;还不能当成可随意替换的物理引擎。
为什么不用高维隐式向量,反而使用速度慢的图像
它要解决的问题和隐空间路线不太匹配。先把层次分开:SyncWorld 内部已经在用高维潜变量(视频 latents + DiT),只是最后一定要解码成图,再拿 VLM 打分。它真正要校准的,是“动作在像素里长什么样” SyncWorld 的核心矛盾是:同一组数值动作,换相机、换摆放、换单臂之后,在图像里的运动完全不同。
视觉标定能成立,是因为人/模型能在图像里直接看到:(+x) 到底是往左、往右,还是几乎不动。 如果世界模型只在隐藏向量里滚动,这段标定视频就失去了接口——你很难用几秒真实像素运动,去对齐一套抽象 latent dynamics
latent / proxy action 可以解释视频变化,但
- 不能直接当可执行的底层控制;
- latent 一致,也不等于换相机外参、换控制器约定后,真实动作效果仍然一致。 所以它选择直接条件于真实低维动作,并在视觉域做 in-context 校准。
隐空间世界模型有优势:
- 状态紧凑,适合大量想象和 RL;
- 规划便宜,不必每步都生成高清视频;
- 可以在 latent 里做可微控制或价值学习。 但它们默认一个更强假设:编码器给出的状态,在新配置下仍然语义稳定。 换相机后,同一动作对应的像素流变了,encoder 特征也会变;若不微调,隐空间动力学很容易漂。SyncWorld 偏偏把“配置一变,映射就变”当成主问题,所以没有走这条路。
| 隐空间 WM | SyncWorld 这种像素/视频 WM | |
|---|---|---|
| 适合 | 固定配置里做 RL、长程规划 | 换相机/换本体后解释动作 |
| 动作 | 常是 latent action / 学出来的控制 | 真实 7-DoF 数值动作 |
| 校准 | 通常要微调 encoder/dynamics | 几秒标定视频放进上下文 |
| 奖励 | 自己学 value/reward | 直接用现成 VLM |
| 代价 | 想象便宜,迁移弱 | 想象贵,但零样本接口好 |
隐空间适合“在同一个世界里做决策”;SyncWorld 要解决的是“先对齐这个世界里动作意味着什么”。 对齐动作语义时,像素是更合适的标定语言;对齐之后,再把未来观测解码成图,现成 VLM 才能当零样本评价器。