Faster-WAM_ Efficient Inference-Time Future Conditioning for Robust World Action Models
Faster-WAM_ Efficient Inference-Time Future Conditioning for Robust World Action Models
一句话总结
Faster-WAM 要解决的是 WAM 的效率–鲁棒性两难:Joint-WAM 推理时保留未来表征,OOD 更好但太慢;Fast-WAM 推理时丢掉未来,ID 仍高、OOD 会崩。本文证明,推理时显式使用未来表征对 OOD 鲁棒性是必要的。具体做法是:利用“高噪声视频潜变量仍含控制相关未来信息”,视频流匹配只在噪声端点前向 1 次;再用非对称注意力让该未来 K/V 与动作轨迹解耦并缓存。动作流匹配仍逐步去噪,但通过 SparseMoT 只在部分层读取未来;Interval KV-Fusion 把各交互区间的多层 K/V 聚合成紧凑上下文,从而在稀疏交互下保住多深度未来信息。结果是 OOD 明显强于 Fast-WAM,同时比 Joint-WAM 更快。
摘要以及引言部分
图1:推理时的未来条件对鲁棒的WAM至关重要。与Joint-WAM(一种代表Joint-WAMs的受控实现)相比,Fast-WAM通过在推理时移除未来条件来提升效率,但在分布偏移下性能显著下降。受这一发现启发,Faster-WAM高效地保留了推理时的未来条件,以更低的延迟实现了强大的OOD鲁棒性。
世界动作模型(World Action Models, WAMs)通过学习环境在当前观测之外如何演化,从而提升机器人操作能力 现有方法面临一个根本性两难:Joint-WAM 在推理阶段保留面向未来的表征,但计算开销过高;而高效替代方案则在推理时去掉未来建模,可能因此丧失时序推理所带来的鲁棒性收益 本文重新审视未来表征在 WAM 中的作用,并表明:推理时未来条件化(inference-time future conditioning)对于分布偏移下的泛化至关重要。
提出 Faster-WAM:一种高效的未来条件化 WAM,它在保留未来表征的同时,避免了昂贵的视频–动作交互,引入一种稀疏未来条件化框架,仅计算一次未来表征,并在动作去噪过程中选择性地复用它们。 提出 SparseMoT,用在少量网络阶段进行选择性视频–动作交互,替代无处不在的逐层融合 提出 Interval KV-Fusion,在不增加注意力复杂度的前提下聚合多层深度的未来表征
在分布偏移条件下(模型训练时见过的场景分布,和测试时面对的场景分布发生了变化)评估了各类 WAM,并观察到:在推理时移除未来表征会显著损害鲁棒性。具体而言,如图 1 所示,相较 Joint-WAM,Fast-WAM 在分布外(OOD)设置中出现明显性能下降。这表明,未来表征不仅是辅助训练目标,更是可泛化时序知识的重要来源。这一发现引出了 WAM 的新设计原则: 未来表征应在推理时予以保留,但其与动作预测的交互必须变得有选择且高效。
提出 Faster-WAM:一种高效的未来条件化世界动作模型。它在保持推理时未来条件化的同时,重新设计了视频–动作交互——不再反复执行视频分支,而是只计算一次未来表征,并在动作去噪过程中通过缓存的中间表征加以复用
引入两种互补机制:
- 第一,SparseMoT 将视频–动作交互集中在少量阶段,并在相邻交互之间进行轻量的纯动作精炼,从而减少不必要计算。
- 第二,Interval KV-Fusion 在每个交互区间内聚合来自多个视频深度的未来表征,在不增加注意力复杂度的前提下提供更丰富的时序信息。
贡献总结如下:
- 我们将推理时未来条件化识别为影响 WAM 泛化的重要因素,表明未来表征除作为训练目标外,还能提供额外鲁棒性。
- 我们提出 Faster-WAM,这是一种通过稀疏且高效的视频–动作交互,在推理时保留时序表征的未来条件化框架。
- 我们引入 SparseMoT 与 Interval KV-Fusion,使模型能够选择性地访问多层次未来表征,而无需承担稠密交互的计算代价。
- 大量实验表明,该方法在分布内与分布外基准上均取得最先进性能,同时提升了推理效率。
方法
图2:Faster-WAM概览。(a) Faster-WAM的整体框架,其特点是采用SparseMoT进行选择性的视频-动作交互,并采用Interval KV-Fusion来聚合多层次的未来表征。(b) Joint-WAM与Faster-WAM的推理对比,将迭代式密集耦合与单次未来上下文缓存及稀疏交互进行对照。
问题定义
在控制步 (t),策略观测到图像 (o_t)、语言指令 (l) 以及本体感觉状态 (s_t),并预测长度为 (H) 的动作块 (A_t = a_{t+1:t+H})。由参数 (\theta) 刻画的 WAM,通过内部视觉接口定义其动作策略:
πθ=pθ(At∣st,l,Rtv),(1)
其中 (R^v_t) 是视频分支由当前观测 (o_t) 得到的内部视觉表征。记 (E_v) 为视觉编码器,(z^0_t = E_v(o_t)) 为当前观测潜变量,(Z_t) 为未来视频潜变量
Joint-WAM(Ye et al. 2026; Bi et al. 2025)联合更新未来视频状态与动作状态,从而在第 (k) 步得到不断演化的视频表征:
Rt,kv,joint=Gv(zt0,Zt(k),l).(2)
这里 (G_v) 表示视频侧表征映射
Fast-WAM(Yuan et al. 2026)则在推理时去掉未来槽位:
Rtv,fast=Gv(zt0,l).(3)
由此得到的接口可在整个动作生成过程中复用,但其构建并不包含显式的未来时序槽位
Faster-WAM 则通过一次视频专家前向,构造固定的面向未来接口 (R^v_t),并在动作生成中通过稀疏交互加以复用(图 2(b))
Faster-WAM
总体概述
如图 2(a) 所示,Faster-WAM 通过混合 Transformer(Mixture-of-Transformers, MoT)架构,将由预训练视频生成器初始化的视频专家与动作专家耦合起来。该架构包含 (L) 个对齐阶段,每一阶段对应一对视频层与动作层。语言与本体感觉作为共享条件信号,同时提供给视频专家和动作专家。一次视频前向会生成逐层注意力的键/值(K/V)层级。Interval KV-Fusion 再将其转换为面向动作的紧凑摘要,由 SparseMoT 在选定阶段暴露给动作分支,其余阶段则用于纯动作精炼。
单次前向的未来条件化
已有工作表明,即便不去完整个去噪过程,也能从高噪声视频潜变量中提取与控制相关的状态。
两个分支都用流匹配(flow matching)来形式化,取 (\tau=0) 为干净数据、(\tau=1) 为高斯噪声,并将视频流时间 (\tau_v) 处的插值未来潜变量记为 (Z_{t,\tau_v}) 为把这些线索提供给动作专家,我们在流时间 (\tau_v) 处保留每个视频注意力块的键/值投影 (K^v_{t,\tau_v,j}) 与 (V^v_{t,\tau_v,j}),其 token 布局和形状在各深度上共享。将它们收集起来,得到
Ct,τvv={(Kt,τv,jv,Vt,τv,jv)}j=1L.(4)
这一原始 K/V 层级,就是后续构造面向动作接口的来源 为使其可在多个动作流步上复用,我们在视频流内部采用非对称注意力:未来槽位可以关注干净锚点以及彼此,而锚点不能关注未来槽位 在专家之间,动作 query 可以读取视频特征,而视频 query 不能读取动作 token 推理时,将 (Z_{t,1}) 设为高斯噪声 (\varepsilon^v_t),即可通过一次视频前向得到固定的原始层级 (C^v_{t,1})。
SparseMoT
SparseMoT 通过把视频读取限制在交互集合上来降低这一重复开销:
J={j1,…,jM}⊆{1,…,L},1≤j1<⋯<jM≤L.(5)
我们按固定层间隔选择 (\mathcal{J}),并在每个动作流步上复用同一集合;因此 (M) 表示每次动作评估中读取视频的阶段数,当 (M=L) 时即退化为稠密 MoT。
为简化记号,下面考虑固定的控制步 (t)、视频流时间 (\tau_v) 与动作流时间 (\tau_a),并省略这些下标。令 (Qa_j)、(Ka_j)、(V^a_j) 表示第 (j) 阶段动作 token 的 query、key 与 value 投影。在 (j_m \in \mathcal{J}) 处,((\widehat{K}^v_{j_m}, \widehat{V}^v_{j_m})) 是概括其前一深度区间的融合视频对(式 (7))。其头维度与动作 K/V 投影匹配,从而可以进行如下更新:
Xjma=Attn(Qjma,[Kjmv;Kjma],[Vjmv;Vjma]),(6)
其中 (\mathrm{Attn}) 为标准注意力,([;]) 表示 token 拼接,(\widetilde{X}^a_{j_m}) 是融合未来摘要与当前动作状态后的动作输出。对于 (j \notin \mathcal{J}),仅进行动作自注意力以及残差/前馈更新,使先前注入的未来信息在动作状态中继续传递,而不再读取视频 K/V
transformer
Q、K、V 是 Transformer 注意力里的三组投影,分别回答三件事:
- Q(Query):当前 token 在问什么
- K(Key):别的 token 能提供什么索引
- V(Value):真正要取走的内容 对每个 token,先用三套不同的线性层得到 (Q, K, V)。注意力本质是:
Attn(Q,K,V)=softmax(dQK⊤)V
流程很简单:用 (Q) 去和所有 (K) 做相似度,得到权重,再按权重把 (V) 加权求和。所以 K 决定“看谁”,V 决定“拿走什么”。 自注意力里,Q、K、V 都来自同一组 token。交叉注意力里,Q 来自一边,K/V 来自另一边。论文式 (6) 把两者拼在一起了:
Xjma=Attn(Qjma,[Kjmv;Kjma],[Vjmv;Vjma])
这里动作 token 用自己的 (Q^a) 去读两路信息:
- 视频未来摘要:(\widehat{K}^v, \widehat{V}^v)
- 当前动作状态:(K^a, V^a)
Interval KV-Fusion
若交互阶段 (j_m) 只消费自身的 K/V 对,则中间表征无法直接暴露给动作通路;若直接拼接它们,又会拉长动作注意力上下文。为此,我们提出 Interval KV-Fusion,将每个交互区间内累积的视频 K/V 对加以聚合
为每个选定阶段 (j_m) 恰好分配一个前置区间 (I_m = {j_{m-1}+1,\ldots,j_m})。对每个区间 (I_m),我们引入经 softmax 归一化的融合权重 (W^{\mathrm{fuse}}_{m,j}),在不拉长动作注意力的前提下聚合该区间各阶段的视频表征。由于各阶段 K/V 对共享相同的 token 布局和维度,(j_m) 的融合对为
(Kjmv,Vjmv)=j∈Im∑Wm,jfuse(Kjv,Vjv).(7)
这一加权和将 (I_m) 中所有阶段的 K/V 信息合并为 (j_m) 处的单一对,同时保持键–值对应关系,以及单个视频阶段的序列长度 Interval KV-Fusion 在 SparseMoT 下保留了多层深度的未来上下文,同时不增加注意力复杂度。
联合训练
Faster-WAM 通过流匹配联合学习视频流场与动作流场。对每个训练样本,视频流时间 (\tau_v) 与动作流时间 (\tau_a) 独立采样,并分别采样高斯噪声 (\varepsilon^v_t) 与 (\varepsilon^a_t):
Zt,τvAt,τa=(1−τv)Zt+τvεtv,=(1−τa)At+τaεta.(9)
给定 ((Z_{t,\tau_v}, \tau_v, z^0_t, l)),视频专家为未来槽位预测视频流 (\hat{u}^v_t),同时生成原始 K/V 层级 (C^v_{t,\tau_v})。Interval KV-Fusion 再将其转换为 (\widehat{C}^v_{t,\tau_v}),并通过 SparseMoT 在选定阶段条件化动作流预测器 (F_a):
u^ta=Fa(At,τa,τa∣st,l,Ct,τvv).(10)
以 (u^v_t = \varepsilon^v_t - Z_t) 和 (u^a_t = \varepsilon^a_t - A_t) 为回归目标,联合目标函数为
L=λvE[Wvflow(τv)∥u^tv−utv∥22]+λaE[Waflow(τa)∥u^ta−uta∥22].(11)
视频与动作的流匹配 MSE 损失分别由依赖流时间的因子 (W^{\mathrm{flow}}_v(\tau_v)) 与 (W^{\mathrm{flow}}_a(\tau_a)) 加权,而 (\lambda_v) 与 (\lambda_a) 用于平衡两个分支的总体贡献。 视频项监督未来视频动态,动作项则促使融合后的层级保留与控制相关的信息。独立采样 (\tau_v) 与 (\tau_a),可使动作通路接触到多种视频噪声与动作噪声的组合。
高效推理
部署时,Faster-WAM 用高斯噪声初始化未来槽位和动作状态。它只在 (\tau_v=1) 处对视频专家评估一次,再对所得原始层级施加 Interval KV-Fusion,得到缓存的面向动作接口 (\widehat{C}^v_{t,1})。
在每个动作流步上,动作专家通过 SparseMoT 复用该缓存,而不再更新或解码未来视频潜变量。如图 2(b) 所示,这将 (N) 次稠密的联合视频–动作评估,替换为一次视频侧前向,再加上 (N) 次稀疏、由缓存条件化的动作评估。
实验
模型与实现
- 视频骨干:Wan2.2-5B,初始化视频 DiT、文本编码器和 VAE。
- 动作专家:30 层 Transformer,隐层宽 1024。
- 每次规划预测 32 步动作;视觉序列为 9 帧(1 当前 + 8 未来),时间间隔为 4。
- 多相机观测先空间拼接到一起,再送入 VAE。
- L=30 个对齐阶段;默认每 4 层交互一次,即 M=8;其余层只做纯动作更新。
- 训练目标:视频流与动作流共用流匹配(flow matching),λ_v = λ_a = 1.0。
- 优化:AdamW,lr=1e-4,wd=0.01,5% warmup 后余弦衰减到 1e-6,梯度裁剪 1.0,BF16,DeepSpeed ZeRO-1。
- 推理:动作 10 步积分,guidance=1.0;默认只做 1 次 视频前向(τ_v=1),再缓存 K/V。
对照原则
三种 WAM 共用同一视频骨干、tokenization、训练数据、优化配方和动作采样,只改推理时未来条件化方式:
- Joint-WAM:视频与动作联合去噪,逐层稠密交互。
- Fast-WAM:训练时有未来建模,推理时去掉未来时序槽。
- Faster-WAM:一次视频前向得到未来上下文,再通过 SparseMoT 稀疏复用。 这样可以把效果差主要归因到:推理时要不要保留未来表征,以及视频–动作如何交互。
数据与训练规模
| 基准 | 任务性质 | 训练数据 | 训练 | 评估 |
|---|---|---|---|---|
| LIBERO | 语言条件操作,4 套(空间/物体/目标/长程),每套 10 任务 | 每套 500 条专家演示 | 10 epoch,bs=128,8×A800,输入 224×448 | 每任务 50 rollouts |
| RoboTwin 2.0 | 50+ 双臂协同任务 | 2,500 clean + 25,000 randomized | 5 epoch,bs=1024,32×A800,输入 384×320 | 每任务 100 次,clean / randomized |
| LIBERO-Plus | 7 类分布偏移 | 不额外训练 | 直接测 LIBERO 训好的策略 | Camera / Robot / Lang / Light / Background / Noise / Layout |
| 真实双臂 | 2× Piper 6-DoF,4 个任务 | 每任务 400 条,共 1600 条 | 5 epoch,bs=512 | 标准设置每任务 30 次;另测 Pick Strawberries 的 3 类 OOD |
真实任务:T1 Pick Strawberries、T2 Build Tower、T3 Store Boxes、T4 Stack Plates。OOD 条件:新背景、改光照、未见干扰物。
实验设计
- 分布内主实验:LIBERO、RoboTwin 2.0。先确认稀疏未来条件化不会牺牲 ID 精度。
- 分布外主实验:LIBERO-Plus。这是核心实验,用来验证“推理时未来表征不是可有可无的训练信号”。
- 真机验证:标准设置 + OOD,看仿真结论能否落到真实双臂。
- 效率验证:L20 上测延迟,证明保留未来表征不一定更慢。
- 消融:把方法拆开,回答 3 个问题:
- 未来槽本身有没有用?比较 Faster-WAM vs 仅当前观测的 C-O Faster-WAM vs Fast-WAM。
- 两个模块各自贡献多少?依次去掉 Interval KV-Fusion、SparseMoT,再退回 Joint-WAM。
- 交互该多密?比较 Dense / Stride-2 / 4 / 7 / 14。
- 附录补充:视频去噪步数是不是越多越好?结果是 1 步最好。
实验效果
分布内:不掉点,甚至略好
LIBERO 平均成功率(无具身预训练的 WAM):
- Fast-WAM 97.6%
- Joint-WAM 98.5%
- Faster-WAM 99.0%(四套都 ≥ 98.2%)
RoboTwin 2.0:
- Fast-WAM 91.9%,Joint-WAM 90.6%
- Faster-WAM 92.6%(clean 92.8%,rand 92.3%)
- 还超过了有预训练的 LingBot-VA(92.2%) 记法:ID 上三种 WAM 都已经很高,LIBERO 区分度不够;真正拉开差距的是 OOD。
分布外:这是论文最硬的证据
LIBERO-Plus 平均成功率:
- Fast-WAM:LIBERO 97.6% → Plus 49.1%,掉得很狠
- Joint-WAM:66.3%,说明保留未来表征确实更稳
- Faster-WAM:73.6%
- 对比:比 Fast-WAM 高约 24.5 个点,比 Joint-WAM 高约 7.3 个点
- 7 类偏移上全面超过 Fast-WAM;6 类超过 Joint-WAM,Layout 基本持平
| 偏移 | Fast-WAM | Joint-WAM | Faster-WAM |
|---|---|---|---|
| Camera | 18.8 | 37.5 | 53.8 |
| Robot | 45.7 | 64.5 | 71.6 |
| Language | 70.1 | 93.0 | 94.7 |
| Light | 83.2 | 95.0 | 96.3 |
| Background | 45.7 | 55.9 | 61.3 |
| Noise | 29.8 | 47.3 | 63.6 |
| Layout | 62.7 | 79.6 | 79.1 |
| Avg | 49.1 | 66.3 | 73.6 |
相机变化和视觉噪声上提升最大,说明未来表征提供的是“接下来场景会怎么变”的时序先验,而不只是当前外观匹配。
真机:结论可迁移
标准设置总成功率:
- Fast-WAM 88.3%,Joint-WAM 90.8%,Faster-WAM 95.8% Pick Strawberries 的 OOD:
- Fast-WAM:标准 96.7% → OOD 平均 45.6%
- Joint-WAM:OOD 55.6%
- Faster-WAM:OOD 71.1%,三类未见条件都最好
延迟
L20,224×448,10 步去噪:
| 模型 | VAE | 视觉 | 动作 | 总计 |
|---|---|---|---|---|
| Joint-WAM | 10.47 | 无法拆开 | 无法拆开 | 559.84 ms |
| Fast-WAM | 10.47 | 27.67 | 276.56 | 320.97 ms |
| Faster-WAM | 10.55 | 43.04 | 192.11 | 252.95 ms |
相对 Joint-WAM:2.21× 加速。 比 Fast-WAM 还快:一次性视觉上下文从 27.67 增到 43.04(+15.4 ms),但 SparseMoT 把反复执行的动作去噪从 276.56 降到 192.11(-84.5 ms),净赚。
消融
(a) 未来条件化本身
- C-O Faster-WAM(同样稀疏交互,但视觉上下文不含未来槽):51.00%
- Fast-WAM:49.14%
- Faster-WAM:73.57%
- Camera:16.25% → 53.75%;Noise:32.95% → 63.57% 结论:架构不是主因,推理时显式访问未来上下文才是 OOD 关键。
(b) 组件累加去掉
- Faster-WAM:73.57%
- 去掉 Interval KV-Fusion:69.99%(中间层未来信息有用)
- 再换成稠密 MoT:69.78%
- 再改回迭代联合去噪(Joint-WAM):66.27% 三个设计是互补的:多深度 KV 融合、稀疏交互、一次可复用未来上下文。
(c) 交互间隔
- Dense:69.78%
- Stride-2:71.65%
- Stride-4:73.57%(默认,最好)
- Stride-7:71.05%
- Stride-14:70.05% 结论:不是越密越好。未来上下文不必每层都喂,但交互太少也不够。默认每 4 层交互一次,是性能和计算的甜点。
(d) 视频去噪步数(附录)
- 1 步:73.57% 最好
- 10 步:掉到 68.33% 结论:高噪声端点的一次前向已经够用;继续把未来视频去噪干净,反而可能损害控制相关表征。这和论文“不必重建完整 rollout”的方法设定一致。
总结
本文揭示了世界动作模型(WAM)的一条关键设计原则:未来表征不应只被当作辅助训练信号,而应作为推理时的必要上下文,以支撑分布偏移下的鲁棒动作预测 Faster-WAM:一种高效的未来条件化框架。它在推理时保留未来表征,同时减少冗余的视频–动作交互 未来工作方面,设计基于学习的策略来决定视频–动作交互阶段,可能是一个有前景的方向;此外,图编译与自定义 CUDA kernel 还可提供互补的系统级加速。
局限性
交互位置仍是人工设定的固定间隔(默认 Stride-4),还不会按任务或样本自适应选择该在哪一层读视频。 加速主要来自算法结构(一次视频前向 + 稀疏交互),还没有做图编译、自定义 CUDA kernel 这类系统级优化。 未来表征如何更有效地被后续 WAM 保留和利用,仍是开放问题,而不是已经完全解决。
未来上下文是一次性、冻结的。 视频专家不算动作 token,动作去噪过程中也不再更新未来视频。这换来了速度,但不是闭环的“边做动作边改未来”。若真实未来强依赖于正在采样的那条动作轨迹,这一设定可能不够。 所谓未来,并不是解码出来的视频。 用的是 τ_v=1 高噪声端点的 K/V。附录也显示视频去噪步数越多,OOD 越差。好处是省算力,坏处是未来质量不可视、不好诊断,也无法用视频指标衡量。 强依赖大型预训练视频生成器(Wan2.2-5B)。没有这个先验,一次噪声前向能否抽出可用的未来线索,论文没有单独证明。 SparseMoT 的间隔、Interval KV-Fusion 的加权求和都偏启发式。融合是把多深度 K/V 压成一对,省了注意力长度,也可能丢掉部分中间信息。
OOD 远未解决。 LIBERO-Plus 平均 73.6%,明显好于 Fast-WAM 的 49.1%,但 Camera 仍只有 53.8%,Background 61.3%、Noise 63.6%。相机、背景、噪声仍是短板。 Layout 上没有赢过 Joint-WAM(79.1 vs 79.6)。稀疏交互并非在所有偏移上都占优。 真机规模偏小。 4 个任务、每任务 400 条演示;OOD 只在 Pick Strawberries 上测了光照/背景/干扰物,覆盖有限。 延迟约 253 ms(L20,10 步)。 比 Joint-WAM 快 2.21×,但对高频闭环控制仍偏慢。 Joint-WAM / Fast-WAM 是受控复现,用来隔离变量很干净,但不等于对所有已发表 WAM 的全面对比。 三种 WAM 都没有具身大规模预训练。平均上 Faster-WAM 最强,但个别视觉偏移上,有预训练的 OpenVLA-OFT 仍然更好(如 Background、Noise)。